AI计算基础设施工程师 - 基础技术
关于这个机会
团队介绍:字节跳动基础设施基础技术团队负责公司统一的基础软件,编译器&语言,DPU,大规模池化存储以及云原生计算集群,AI for Infra,Infra for AI 等相关领域,覆盖了在线存储、实时、离线、机器学习、软硬一体、AIOps 等多种应用场景,支持公司内外广泛的场景和需求。字节跳动Data基础技术团队整体负责字节跳动计算基础设施建设与维护工作;包含智算、通算场景的计算集群管理与资源调度、训练推理基础设施、DPU、系统虚拟化、Agent Infra、基础软件以及 AI for Infra 等相关技术领域。团队覆盖字节跳动在线服务、离线计算、训练推理、Agent、B 端弹性计算等业务场景,并依赖软硬一体和 AI 能力,持续为公司内外广泛业务提供稳定、高性能的基础设施服务。 1、负责AI计算基础设施的规划、建设与持续优化,面向大规模模型训练与推理场景,设计并构建与运维以GPU等加速器为核心的计算、网络、存储与调度体系; 2、结合模型并行策略与底层硬件拓扑,持续提升系统整体性能、资源利用率及稳定性,保障关键业务负载的高效运行; 3、参与基于Kubernetes的算力调度与资源管理平台建设,实现多租户隔离、弹性伸缩及任务级资源精细化管理; 4、通过性能分析、故障定位与成本优化手段,在性能、可靠性与成本之间进行系统性权衡,推动AI算力能力的平台化与产品化落地,支撑业务规模化发展。
任职要求
1、具备Kubernetes集群管理、开源系统开发及性能优化经验; 2、熟悉语言模型(LLM)及相关扩展模型的基本原理,参与过模型推理和训练基础设施的研发; 3、熟悉Linux环境下的程序开发与性能优化,具备内核、存储、网络或GPU驱动等相关开发经验者优先。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。