AI推理平台-AIGC推理基础设施研发工程师-北京/杭州
关于这个机会
具体职责包括: 1. 模型服务架构:负责 AIGC 模型服务框架的设计与研发,建设统一的模型接入协议、Stage 编排、Engine 管理和 Runtime 能力,支持图像、视频生成等模型快速接入,降低能力形态与硬件组合增长带来的交付复杂度。 2. 分布式推理与性能优化:围绕 DiT 等计算密集型模型,参与并行方案设计,分析计算、通信、显存和 Pipeline Bubble 等核心瓶颈;结合 Profiling、通信计算重叠、Batching、CUDA Graph、算子融合等手段,持续优化任务时延、吞吐、显存占用、GPU 利用率和单位推理成本。 3. 调度与资源效率:面向分辨率、视频时长、采样步数等差异化请求,建设请求调度队列、批处理、QoS、流量路由和弹性伸缩能力;探索 Cohort Scheduling、动态 Pipeline、异构资源池调度等方案,在保障服务质量的前提下提升闲置资源和低成本资源的使用效率。 4. 下一代推理架构:参与 NVLink/NVSwitch等高速互联环境下的 Supernode-Native Serving 探索,建设拓扑感知的进程组管理、角色编排、进程生命周期和请求调度能力,推动新硬件、新并行方案在更大并行域下继续scale的平台能力。
任职要求
1. 计算机、软件工程、人工智能等相关专业,熟练使用 Python;具备 C++、CUDA、Rust 等开发经验者优先。 2. 具备 2 年及以上 AI Infra、模型推理、分布式系统或 GPU 服务相关经验,熟悉 PyTorch 及其分布式执行机制。 3. 熟悉多机多卡系统中的进程组、集合通信、显存管理和并行计算,有 FSDP、TP、SP、EP、PP 等多种并行方案的实践经验。 4. 具备良好的系统设计和抽象能力,能够从单模型需求中识别共性问题,设计可扩展、可观测、可灰度和可回滚的平台能力。 5. 有责任心和结果意识,具备良好的沟通、执行与跨团队协作能力,能够推动复杂技术方案从设计、验证走向生产落地。 加分项 ● 有图像、视频生成、Diffusion 或 DiT 模型服务经验。 ● 熟悉 Diffusers、xDiT、vLLM、SGLang 或其他推理框架。 ● 有 CUDA、Triton、NCCL、Nsight Systems/Compute 等性能优化与 Profiling 经验。 ● 有 Kubernetes、大规模在线服务、异构 GPU 调度、弹性伸缩或超节点相关经验。 ● 有推理框架、分布式系统或性能优化方向的开源贡献。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。