← 发现更多职位
字节跳动
社招 · 正式

SRE AI高级工程师-基础架构

面议
Hangzhou(杭州) · 经验要求见详情
研发基础架构社招 · 正式A79398

关于这个机会

1、负责海量高性能GPU/XPU卡的资源交付与一致性保障,涵盖万卡大模型训练、在线推理、在线搜索、推荐训练等不同业务场景的集群管理; 2、学习并深入了解GPU业务方的使用姿势和训练框架,掌握前沿AI大模型技术,解决超大规模场景下的稳定性挑战,涉及NVIDIA H100、A100、昇腾、以及自研XPU等高性能卡型的使用; 3、构建自动化工程,确保生产环境的稳定性和资源在线率,及时发现并隔离故障GPU资源,提高资源流转效率; 4、通过优秀的工程架构设计,参与生产集群和服务的整个生命周期,满足可持续发展的需求并提高系统稳定性,包括架构规划、评审、设计、部署和上线等环节。

任职要求

1、本科及以上学历,计算机相关专业或具备同等实践经验,拥有5年以上SRE相关工作经验; 2、熟悉GPU/XPU资源管理和调度,具备高性能计算集群的管理经验; 3、具备深厚的计算机系统基础知识,了解操作系统、存储和网络IO等相关原理; 4、具备以下一项或多项软件开发经验:Go/Python/Java/C++等,能够编写高效、稳定的系统工具和自动化脚本; 5、有丰富的生产环境故障排查和性能调优经验,能够快速定位和解决问题;熟悉AI大模型训练框架(如TensorFlow、PyTorch等),了解大规模分布式训练的实现细节和优化方法; 6、具备优秀的沟通和协作能力,能够与业务方、开发团队紧密合作,推动项目顺利进行;具有高度的责任感和主动性,能够在快节奏下保持高效工作。 优先条件 1、具备计算集群管理经验,尤其是在大数据和AI大模型训练场景下的经验; 2、熟悉NVIDIA H100、A100等高性能计算卡的使用和优化; 3、具备系统化思维和工程化研发能力,能够设计和实现复杂系统的自动化解决方案; 4、英语口语流利,能够用英语进行流畅的沟通和表达,完成全球协作任务; 5、具有产品和工程思维,具备良好的项目管理能力、数据结构和系统设计能力者优先。

官方来源与核验

字节跳动官方招聘 · 职位编号 7506433042170743047

官方发布时间:

最近核验:2026-09-16T12:33:12.416632+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。