← 发现更多职位
面壁智能
社招 · 全职

多模态RL infra工程师

面议
北京 / 上海 / 成都 / 深圳 · 经验要求见详情
技术开发社招 · 全职A79965

关于这个机会

1、RL训练框架搭建与优化:建设支持多模态大模型后训练的RL基础设施,包括SFT、DPO、GRPO等算法的训练框架开发与性能调优。 2、训练效率提升:优化RL训练的资源调度、通信模式与计算-通信重叠,降低显存占用与训练耗时,提升端到端训练吞吐。 3、训练稳定性保障:建立训练监控与容错机制,解决大规模RL训练中常见的训推不一致、reward hacking、loss震荡等问题。 4、多模态模型适配:支持图文理解模型与全模态模型(MiniCPM-V/o)的RL后训练,解决视觉/音频模态与文本模态在RL训练中的效率与对齐问题。 5、工具链建设:协助算法团队搭建数据流水线、评测链路和模型迭代闭环,提升整体研发效率。

任职要求

职位要求 1.本科及以上学历,了解常见强化学习算法的相关原理、实现方式、优化策略; 2.具备搭建、优化和维护强化学习训练基础设施(Infra)的经验; 3.熟悉集群资源管理、监控与CI/CD等Infra体系,能保障训练平台稳定性; 4.熟悉至少一种主流的RLHF框架,如OpenRLHF/VeRL/ChatLearn等; 5.了解分布式训练基本原理,熟悉通信库的相关工作原理; 6.有良好的沟通合作能力、快速学习和应用新技术的能力、及基本的英文文献阅读能力。 加分项: 1.有强化学习项目实施经验; 2.熟悉模型部署和推理优化; 3.了解云平台部署和容器化技术。

官方来源与核验

面壁智能官方招聘 · 职位编号 7655595321116510518

官方发布时间:

最近核验:2026-09-16T12:07:31.744571+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。