← 发现更多职位
字节跳动
社招 · 正式

机器学习平台存储研发工程师-Data AML

面议
Beijing(北京) · 经验要求见详情
研发社招 · 正式A29357

关于这个机会

1、负责机器学习系统存储相关组件的设计和开发,服务于各方向场景(NLP/CV/Speech等)的模型训练、模型评估和模型推理; 2、设计和实现面向训练/推理场景的多层级存储系统,综合利用显存、本地内存、分布式内存/磁盘、远端大容量存储系统(HDFS/对象存储)等多种介质进行数据的存储和迁移管理,实现「近计算缓存+远端大容量存储」的一体化分级系统,高效数据流动; 3、负责Kubernetes场景下多级存储系统的接入、管理、运维、监控,确保稳定性; 4、负责多机房、多地域、多云场景的系统搭建和容灾,优化跨集群的数据摆放。

任职要求

1、熟练掌握Linux环境下的C++/Go/Python/Shell等1至2种以上语言; 2、熟悉Kubernetes架构和生态,熟悉PV/CSI等云原生容器存储技术,有丰富的机器学习系统实践和开发经验; 3、掌握分布式系统原理,参与过分布式系统的设计、开发和维护; 4、有优秀的逻辑分析能力,能够对业务逻辑进行合理的抽象和拆分; 5、有强烈的工作责任心,较好的学习能力、沟通能力和自驱力,能够快速响应并采取行动; 6、有良好的工作文档习惯,按要求及时撰写、更新工作流程及技术文档。 加分项 1、熟悉至少一种主流的机器学习框架/推理引擎(例如vLLM/SGLang/PyTorch); 2、有大模型推理/训练相关的技术落地经验; 3、熟悉分布式缓存系统(例如Alluxio、JuiceFS、GooseFS、JindoFS)等; 4、熟悉NVLink、RDMA、NCCL、GPU Direct等技术。

官方来源与核验

字节跳动官方招聘 · 职位编号 7633755856546777349

官方发布时间:

最近核验:2026-09-16T12:33:12.416632+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。