腾讯
社会招聘微信WeLM-大模型研发基础设施工程师-研发效能方向(深圳、上海、广州)
面议
关于这个机会
1.面向研发迭代过程中的典型负载优化调度、路由、部署策略,优化系统吞吐和稳定性; 2.建设并运营面向模型研发的沙箱 CPU 集群与工具执行环境,负责环境隔离、任务编排、资源调度与运行治理,保障评估和实验任务稳定执行; 3.建设并运营 GPU 集群、Kubernetes 和数据系统,提升资源利用率、任务吞吐和端到端研发效率; 4.负责研发生产系统的 SLA、可观测性与故障恢复,定位性能瓶颈和异常波动,保障关键任务与评估结果稳定、可复现、可诊断; 5.与算法、评估和推理基础设施团队共同定义真实研发负载,持续演进面向前沿模型迭代的系统能力。
任职要求
1.具备扎实的分布式系统或 ML Systems 经验,能够设计和维护持续运行的大规模生产系统; 2.熟悉任务调度、工作流系统、容器或沙箱、Kubernetes、存储、消息系统以及可观测性中的一个或多个领域; 3.对大模型训练、推理、评测、合成数据或强化学习 Rollout 有实际经验或强烈兴趣; 4.能够同时关注系统可靠性与研究正确性,理解“系统成功运行”和“产生可信模型结论”之间的差异; 5.乐于深入模型研发现场,理解研究工作流,并将快速变化的实验需求抽象为可靠、可复用的系统能力; 6.希望自己的系统工作直接影响前沿模型的数据、评估和训练迭代,而不仅仅是优化一般软件开发流程。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。