← 发现更多职位
字节跳动
社招 · 正式

GPU云服务器稳定性架构师-计算

面议
Hangzhou(杭州) · 经验要求见详情
研发后端社招 · 正式A79267

关于这个机会

1、负责公有云场景下GPU云服务器的稳定性架构设计与优化,主导从底层硬件适配到上层软件栈的全链路稳定性保障方案落地,构建GPU云服务器稳定性监控与预警体系,实现潜在风险的提前识别与自动化处置; 2、深入分析GPU云服务器在运行过程中的稳定性瓶颈,包括但不限于GPU硬件故障、驱动兼容性问题、虚拟化层性能损耗等,解决GPU云服务器在集成、测试、上线及运维过程中的复杂稳定性问题; 3、跟踪GPU技术及公有云领域的稳定性技术前沿,将业界先进实践引入团队,持续提升GPU云服务器的稳定性水平与核心竞争力。

任职要求

1、5年以上公有云基础设施开发或GPU相关技术领域工作经验,其中至少2年以上稳定性架构设计或技术攻坚经验; 2、精通GPU硬件原理(如CUDA、显存管理、算力调度等)及主流GPU驱动的工作机制,能够独立分析并解决GPU相关的底层技术问题; 3、熟练运用至少一种编程语言(如C/C++、Go、Python)进行技术方案实现与问题定位,具备较强的代码读写能力与技术攻关能力; 4、具备良好的系统性思维与问题分析能力,能够从硬件、驱动、虚拟化、业务等多维度拆解GPU云服务器稳定性问题,并制定可实施的解决方案。 具备以下条件者优先: 1、有公有云厂商GPU云服务器产品稳定性架构设计或核心开发经验;具备GPU相关故障排查工具(如NVIDIA-smi、NVIDIA-debugdump、Nsight等)的深度使用经验或自定义GPU监控/诊断工具开发经验; 2、具备优秀的沟通协调能力与团队协作精神,能高效推动跨部门项目进展,有较强责任心,可应对复杂业务场景下的紧急稳定性故障;有AI训练/推理场景下GPU云服务器稳定性保障经验。

官方来源与核验

字节跳动官方招聘 · 职位编号 7550894518461499655

官方发布时间:

最近核验:2026-09-16T12:33:12.416632+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。