← 发现更多职位
字节跳动
社招 · 正式

AI Infra效率工程专家 - TikTok研发

面议
Shenzhen(深圳) / Hangzhou(杭州) · 经验要求见详情
研发社招 · 正式A255196A

关于这个机会

团队介绍:TikTok研发团队,旨在实现TikTok业务的研发工作,搭建及维护业界领先的产品。加入我们,你能接触到包括用户增长、社交、直播、电商C端、内容创造、内容消费等核心业务场景,支持产品在全球赛道上高速发展;也能接触到包括服务架构、基础技术等方向上的技术挑战,保障业务持续高质量、高效率、且安全地为用户服务;同时还能为不同业务场景提供全面的技术解决方案,优化各项产品指标及用户体验。 在这里, 有大牛带队与大家一同不断探索前沿, 突破想象空间。 在这里,你的每一行代码都将服务亿万用户。在这里,团队专业且纯粹,合作氛围平等且轻松。目前在北京,上海,杭州、广州、深圳分别开放多个岗位机会。 1、分析大模型训练、推理及RL/SFT等业务负载,建立性能与资源使用画像,定位计算、显存、通信、存储和调度瓶颈,制定优化方案,并通过生产数据验证收益; 2、负责AI运行时与模型服务优化,围绕异构GPU适配、模型加载与启动、推理引擎、并行策略和缓存机制,提升吞吐,改善响应时延与任务完成时间,提高资源使用效率; 3、建设效率治理平台,将负载分析、性能诊断、资源治理和收益评估沉淀为可复用的工程能力,为容量规划、资源分配和持续优化提供支持,保障平台可靠性、可扩展性与可维护性; 4、跟进并评估AI Infra前沿技术,结合业务约束开展技术选型与方案设计,与算法、模型引擎和基础设施团队协作,完成能力研发、生产落地及效果评估。

任职要求

1、计算机基础扎实,熟悉操作系统、计算机网络、并发编程和分布式系统;熟练掌握Go、C++、Python、Java等至少一门编程语言,具备良好的系统设计和工程实现能力; 2、理解GPU运行机制及计算、显存、通信之间的关系,熟悉模型训练或推理流程,具备后端研发系统研发、部署或性能优化经验,能够结合实际负载分析系统瓶颈; 3、在以下至少一个方向具备深入实践:训练与推理性能优化,如PyTorch、vLLM/SGLang、Nsight等相关开发与分析;异构资源调度,如Kubernetes、资源编排、弹性伸缩与混部;效率诊断与治理平台,如负载画像、性能分析、资源利用率及成本优化; 4、能够独立分析和解决复杂生产问题,在性能、成本、稳定性与工程复杂度之间作出合理权衡;具备跨团队沟通与推动能力,能够将方案转化为工程实现,并以数据验证优化效果; 5、有AI Infra相关开源项目贡献,或自动诊断、自动调优、Agent应用开发、AI Coding实践经验者优先。

官方来源与核验

字节跳动官方招聘 · 职位编号 7684210155764631861

官方发布时间:

最近核验:2026-09-16T12:33:12.416632+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。