Infra平台开发工程师-Data AML
关于这个机会
1、AI基础设施平台研发:参与/负责面向大规模GPU集群、分布式存储与高性能网络的资源管理、调度、配额、隔离等平台能力建设,支持万卡级训练与大规模推理场景; 2、资源效率与成本优化:围绕GPU利用率、显存/算力/存储/带宽等关键指标,构建可观测体系并推动调度策略、混部、弹性伸缩、潮汐复用等优化方案落地; 3、稳定性体系建设:建立覆盖容量、变更、故障、应急的稳定性体系,主导/参与SLO定义、容量规划、故障演练、应急预案、Postmortem等工作,持续降低MTTR与故障影响面; 4、研发体系标准化:沉淀AI训练/推理/数据流水线的研发规范、模板与工具链(CI/CD、版本管理、环境管理、镜像管理、配置管理等),推动跨团队研发流程的统一与提效; 5、AIOps智能运维:基于平台大盘指标、日志、Trace、事件等数据,建设异常检测、告警降噪、根因定位、容量预测、自动化处置等智能运维能力;探索大模型/Agent在AI Infra运维场景的落地。
任职要求
1、本科及以上学历,计算机、软件工程、人工智能等相关专业;3年以上后端研发工作经验; 2、扎实的编程功底,熟悉Go/Python/Java中至少一门,具备良好的工程架构与代码质量意识;熟悉Python Flask、Celery、DjanGo、Tornado、NumPy等框架和库使用或熟悉Golang BeeGo、Gin、Gorm、Sarama,gRPC-Go等常见开源框架; 3、熟悉分布式系统、微服务架构,了解可观测性体系(OpenTSDB、Prometheus、Grafana、ELK、OpenTelemetry等),OLAP数据库ClickHouse使用; 4、具备以下任一方向经验者优先: 1)时序异常检测、告警降噪、根因分析等AIOps算法落地经验; 2)大模型/RAG/Agent应用开发经验; 3)监控、日志、Trace数据处理与平台建设经验; 5、良好的问题分析与解决能力,较强的沟通协作能力和主动性,能在复杂系统中快速定位与解决问题。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。