← 发现更多职位
面壁智能
社招 · 全职

强化学习算法工程师

面议
北京 · 经验要求见详情
技术算法社招 · 全职A52572

关于这个机会

1. 算法研究与开发; 2. 深入研究强化学习领域的前沿算法(PPO、GRPO等)并应用于大模型领域; 3. 优化强化学习训练框架,提升训练速度与稳定性; 4. 大规模应用强化学习,以提升模型模型长思考能力、通用能力、Agent能力等。

任职要求

1. 计算机科学、人工智能、机器学习、数学、统计学或相关领域的硕士及以上学历; 2. 熟练掌握强化学习经典算法(如PPO、GRPO等),并具备实际项目经验 3. 紧跟学术前沿,积极探索前沿算法,针对实际项目中的问题优化算法 4. 熟悉深度学习框架(如TensorFlow、PyTorch)和强化学习训练框架(如verl、openrlhf、trl、nemo-aligner等) 5. 了解大规模分布式模型训练(如deepspeed、FSDP、megatron等) 6. 具备扎实的编程能力,熟练使用Python,熟悉常用数据结构和算法 7. 具备较强的学习能力和解决问题的能力,能够快速学习新技术,基础扎实,动手能力强。 加分项:在顶级会议(如NeurIPS、ICLR、ACL、EMNLP、NAACL等)发表过强化学习相关论文,有ACM、NOI等编程竞赛经验

官方来源与核验

面壁智能官方招聘 · 职位编号 7605074288802171155

官方发布时间:

最近核验:2026-09-16T12:07:31.744571+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。