← 发现更多职位
阿里巴巴控股集团
社会招聘

基础设施与稳定性工程-中间件运维工程师/专家-杭州

面议
杭州 · 3年以上
技术类-运维本科社会招聘

关于这个机会

【团队介绍】 阿里巴巴中间件团队是集团基础技术的核心支撑力量,负责消息、服务发现与软负载、分布式协调、任务调度)、配置管理等核心中间件产品在集团内部的稳定性保障与运维体系建设。 这些中间件承载了阿里集团几乎所有在线业务的流量调度、服务通信与数据流转,覆盖电商、物流、本地生活、云计算、大文娱等 BU,日均处理万亿级消息、百万级服务节点调度,是每年双 11 大促的底层生命线。 团队当前重点方向: 1、稳定性工程 — 从准入规范、变更管控到容灾演练的全链路保障体系,目标全年中间件可用性 99.99%; 2、AI 智能运维(Agentic SRE) — 将运维经验沉淀为 Agent Skills,通过 LLM + MCP 实现告警自愈、风险治理、架构演进,通过 AI 提升中间件产品的稳定性 我们相信:下一代 SRE 不只是运维工程师,更是用 AI 重新定义运维的人。 如果你既有系统功底,又对用技术杠杆 10x 提效充满热情,这里是你的主场。 【职责描述】 1. 负责阿里巴巴集团核心中间件(软负载 / 消息 / ZooKeeper / 配置中心等)的稳定性保障,包括故障定位、性能调优、容量规划与成本治理; 2. 主导中间件重大风险识别、应急预案设计与容灾演练,确保分钟级恢复能力; 3. 建设中间件 + AI 智能运维体系(Agent / Skills / MCP),实现 10x 效率提升,将人工经验沉淀为可复用的自动化能力; 4. 面向业务需求提供中间件选型建议与架构方案,联动产品和开发推动落地; 5. 参与大规模集群建站、大促备容及架构升级,支撑集团业务持续增长。

任职要求

1. 对运维体系、运维理念以及大规模高性能网站架构有深入理解和实践经验; 2. 熟悉 Java / Go / Python 至少一门语言,能读能写能排查; 3. 计算、存储、网络基本功扎实,精通 Linux 系统管理与性能调优; 4. 熟悉分布式系统原理(一致性、高可用、高并发),有中间件或基础设施运维经验优先; 5. 熟悉 Docker + Kubernetes,具备容器化环境下的运维实战能力; 6. 熟悉 AI Agent 架构,认同和理解 AI Native工作方式,在 LLM 应用有真实落地经验(LangChain / Agent / MCP / Skills 中至少一项); 7. 加分项:参与过开源中间件项目(RocketMQ / Dubbo / Nacos / ZooKeeper / Envoy 等),或有大规模集群运维经验; 8. 主动、乐观、皮实、心细,能扛得住大规模系统的不确定性。 9.英文听说读写流利,能够和海外团队对接

官方来源与核验

阿里巴巴官方招聘 · 职位编号 100018300004

最近核验:2026-09-16T10:04:11.465664+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。