字节跳动
社招 · 正式AI计算基础设施工程师-基础技术
面议
关于这个机会
1、负责AI计算基础设施的规划、建设与持续优化,面向大规模模型训练与推理场景,设计并构建与运维以GPU等加速器为核心的计算、网络、存储与调度体系; 2、结合模型并行策略与底层硬件拓扑,持续提升系统整体性能、资源利用率及稳定性,保障关键业务负载的高效运行; 3、参与基于Kubernetes的算力调度与资源管理平台建设,实现多租户隔离、弹性伸缩及任务级资源精细化管理; 4、通过性能分析、故障定位与成本优化手段,在性能、可靠性与成本之间进行系统性权衡,推动AI算力能力的平台化与产品化落地,支撑业务规模化发展。
任职要求
1、具备Kubernetes集群管理、开源系统开发及性能优化经验; 2、熟悉语言模型(LLM)及相关扩展模型的基本原理,参与过模型推理和训练基础设施的研发; 3、熟悉Linux环境下的程序开发与性能优化,具备内核、存储、网络或GPU驱动等相关开发经验者优先。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。