Agentic Infra 实习生
关于这个机会
我们在构建一套“自我优化”的大模型训练系统,你将参与以下核心方向: 1. 参与模型训练,构造在高性能/infra侧专用的模型 2. 构建统一的训练 Harness 范式,标准化训练、benchmark 与评测流程 3. 探索 Agentic Infra,将训练系统从人工驱动升级为 Agent 驱动 4. 推动训练系统从工具集合向具备自我优化能力的系统演进
任职要求
1. 具有较强工程能力,能独立完成复杂系统模块的设计与实现 2. 熟练使用 Python,具备扎实的代码能力(C++ / CUDA 为加分项) 3. 熟悉 PyTorch,有实际训练 / 调试经验 4. 理解分布式系统或分布式训练的基本概念 5. 对系统问题有良好的拆解能力,能从复杂现象中定位本质问题 6. 对 AI Native / Agent 系统有兴趣,认可“用模型解决工程问题”的方向 7. 对数据敏感:能判断指标是否可信、实验是否有效,而不是盲目跑实验 加分项(重要但不硬性) 1. 有算子开发经验(CUDA / Triton / Kernel 优化) 2. 有大模型训练经验(Megatron / DeepSpeed / FSDP 等) 3. 有性能分析经验(Nsight Systems / Nsight Compute / profiler 等) 4. 熟悉训练优化手段(FlashAttention / ZeRO / 混合精度 / checkpointing 等) 5. 对 Agent 有深入理解或实践(tool use / planning / multi-agent 等) 6. 阅读或改过大型训练框架源码 7. 做过 benchmark / profiling / 自动化实验平台相关工作
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。