← 发现更多职位
字节跳动
社招 · 正式

资源调度与计算效率研发工程师/架构师 - AI算力基础设施

面议
Beijing(北京) / Hangzhou(杭州) / Shanghai(上海) · 经验要求见详情
研发后端社招 · 正式A246060A

关于这个机会

团队介绍:字节跳动基础设施部门,负责字节跳动的全栈算力基础设施,从芯片服务器产研、到超大规模数据中心,到传统云平台和如今的AI Native Cloud,全方位为抖音、豆包、今日头条、飞书、火山引擎等各类产品提供领先、稳定的百万量级大规模算力基础设施服务。我们的领域涵盖数据中心建设、内核操作系统开发、服务器集群管理、高速网络通信、EB级数据存储体系、搜索型数据库探索、基于LLM的AI基础设施的研发调度与治理等,致力于打造业界领先的、面向LLM的AI云原生基础设施架构与产品矩阵。 1、参与字节跳动泛调度系统建设,覆盖资源配额、跨地域与跨集群调度、单集群调度和单机资源管理等环节; 2、面向在线服务、大数据计算、AI训练与推理、数据库和存储等负载,设计统一的资源表达、配额、优先级、抢占、弹性和容灾机制; 3、解决超大规模调度系统中的性能、可用性、一致性、资源碎片、热点及调度质量问题; 4、推动GPU、CPU、内存、SSD、网络、内存带宽和电力等多维资源的联合调度与精细化管理; 5、面向大模型训练与推理场景,建设Gang调度、GPU拓扑亲和、异构卡型适配、GPU共享、弹性资源池及碎片治理等能力; 6、建设资源画像、智能策略、仿真评估和实验反馈体系,通过调度、重调度、弹性伸缩、混部和并池等手段,支撑AI弹性资源池、资源并池、数据库上云等公司级项目,将系统能力转化为稳定性、交付效率和成本收益。

任职要求

1、具备扎实的计算机基础,熟悉数据结构、算法、操作系统、计算机网络和分布式系统; 2、熟练使用Go、C++、Java、Rust等至少一种编程语言,具备良好的系统设计和工程实现能力; 3、熟悉Kubernetes、Yarn、Mesos、Slurm等至少一种资源管理或调度系统,理解其核心架构和调度机制; 4、对集群、资源调度或系统性能有深入兴趣,能够分析和解决复杂的生产系统问题; 5、具备较强的系统抽象和数据分析能力,能够在业务需求、系统复杂度、稳定性和资源效率之间做出合理取舍; 6、具备良好的沟通和推动能力,能够与业务、SRE、内核、服务器、网络、存储等团队共同推进复杂项目。 加分项: 1、有集群管理、资源调度、资源混部、容量规划或资源利用率优化经验; 2、熟悉GPU调度及硬件拓扑,包括异构卡型、Gang Scheduling、PCIe、NUMA、NVLink、NVSwitch、GPU共享或碎片治理; 3、熟悉AI训练与推理工作负载,以及CUDA、NCCL、RDMA、PyTorch、TensorFlow等相关技术; 4、具备运筹优化、机器学习、强化学习、仿真系统或在线实验平台的研发经验; 5、有Kubernetes、调度系统、容器运行时或Linux内核等开源社区贡献经验。

官方来源与核验

字节跳动官方招聘 · 职位编号 7678996985638275381

官方发布时间:

最近核验:2026-09-16T12:33:12.416632+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。