← 发现更多职位
腾讯
社会招聘

机器学习平台SRE工程师(深圳/北京)

面议
深圳 · 三年以上工作经验
技术TEG太极中国

关于这个机会

1.负责机器学习平台的整体 SLA/SLO 定义、监控告警体系建设与故障应急响应,持续提升系统可用性,保障平台各个链路的稳定通畅; 2.负责机器学习平台的架构治理,容灾设计,性能调优。对接AI训练链路、资源调度与存储能力,参与业务和系统的问题排查工作; 3.负责运维运营工作自动化,借助AI能力来解决日常工作问题,包括资源管理、变更管理、故障恢复、用户工具诊断接口/mcp等。

任职要求

1.计算机相关专业本科及以上学历,2年以上运维开发项目经验; 2.熟练掌握Python/Go/Java/Shell等1至2种以上语言; 3.有大型分布式系统,在离线任务调度与资源管理系统的运维经验,有高并发、高可用、可扩展等相关实践,熟悉Kubernetes生态和架构; 4.具备系统性能调优实战经验,能定位并解决复杂的性能瓶颈问题; 5.熟悉数据库原理,有Mysql、PostgreSQL等DB性能调优、索引优化、慢查询治理经验; 6.具有强烈的工作责任心和自驱力,出色的学习沟通能力与逻辑分析能力,良好的团队合作精神; 7.加分项:; 8.有 LLM / 多模态大模型训练或推理场景的稳定性与性能优化经验; 9.熟悉 Agent / Harness 应用架构与设计理念,有相关系统的研发、部署或运维实践经验; 10.了解机器学习技术原理,了解分布式训练框架(PyTorch、DeepSpeed、Megatron 等)及推理引擎(vLLM、SGLang 等)的调优与使用; 11.参与过 GPU 集群运维,有 NVIDIA GPU、NCCL、RDMA / InfiniBand 高速网络运维调优经验。

官方来源与核验

腾讯官方招聘 · 职位编号 2090358653394796544

最近核验:2026-09-16T14:24:32.302972+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。