← 发现更多职位
字节跳动
社招 · 正式

Infra平台开发工程师-Data AML

面议
Beijing(北京) · 经验要求见详情
研发后端社招 · 正式A66864

关于这个机会

1、AI基础设施平台研发:参与/负责面向大规模GPU集群、分布式存储与高性能网络的资源管理、调度、配额、隔离等平台能力建设,支持万卡级训练与大规模推理场景; 2、资源效率与成本优化:围绕GPU利用率、显存/算力/存储/带宽等关键指标,构建可观测体系并推动调度策略、混部、弹性伸缩、潮汐复用等优化方案落地; 3、稳定性体系建设:建立覆盖容量、变更、故障、应急的稳定性体系,主导/参与SLO定义、容量规划、故障演练、应急预案、Postmortem等工作,持续降低MTTR与故障影响面; 4、研发体系标准化:沉淀AI训练/推理/数据流水线的研发规范、模板与工具链(CI/CD、版本管理、环境管理、镜像管理、配置管理等),推动跨团队研发流程的统一与提效; 5、AIOps智能运维:基于平台大盘指标、日志、Trace、事件等数据,建设异常检测、告警降噪、根因定位、容量预测、自动化处置等智能运维能力;探索大模型/Agent在AI Infra运维场景的落地。

任职要求

1、本科及以上学历,计算机、软件工程、人工智能等相关专业;3年以上后端研发工作经验; 2、扎实的编程功底,熟悉Go/Python/Java中至少一门,具备良好的工程架构与代码质量意识;熟悉Python Flask、Celery、DjanGo、Tornado、NumPy等框架和库使用或熟悉Golang BeeGo、Gin、Gorm、Sarama,gRPC-Go等常见开源框架; 3、熟悉分布式系统、微服务架构,了解可观测性体系(OpenTSDB、Prometheus、Grafana、ELK、OpenTelemetry等),OLAP数据库ClickHouse使用; 4、具备以下任一方向经验者优先: 1)时序异常检测、告警降噪、根因分析等AIOps算法落地经验; 2)大模型/RAG/Agent应用开发经验; 3)监控、日志、Trace数据处理与平台建设经验; 5、良好的问题分析与解决能力,较强的沟通协作能力和主动性,能在复杂系统中快速定位与解决问题。

官方来源与核验

字节跳动官方招聘 · 职位编号 7380190561422428453

官方发布时间:

最近核验:2026-09-16T12:33:12.416632+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。