数据技术及产品部-RL Data Rubric 算法设计专家-Work
关于这个机会
1. Reward / Rubric 设计:和领域专家一起把领域专业判断(漏洞是否成立、时序是否收敛、回答是否可用等)拆成可自动化验证的评分规则,覆盖硬验证(工具退出码 / 规则)+ 数值指标 + milestone + LLM judge 的多层组合;根据任务特性选择合适的奖励形态——dense reward(过程 / 分步奖励)、sparse reward(结果奖励)、process / outcome reward、reward shaping 与多目标加权,设计可训练、抗 hacking 的奖励信号。 2. RLVR / RLHF 训练落地与反查:用设计出的 reward / rubric 真实训练模型(SFT / GRPO / DPO / RLVR / RLHF),独立跑通训练闭环,从训练曲线与 benchmark 结果反查 reward 与数据的问题,形成"设计 → 训练 → 反查"迭代闭环。 3. Reward Hacking 识别与改正:识别评分规则里可能被模型钻空子的路径,定位训练中出现的 hacking 现象并改正规则 / reward,对已上线 rubric 做持续 hacking 检测与规则加固。 4. RL 数据筛选与领域标注转化:对海量候选数据做面向 RL 的精筛,识别"表面合理但实际错误"、难度合适、覆盖度合理的样本,设计筛选阈值与采样策略,平衡数据规模与质量;把领域标注标准与规范转成 reward 计算逻辑与训练样本,与专家共同定义黄金集与奖励信号。 5. 效果验收:持续跟踪 rubric / reward 上线后对训练效果的实际提升,输出版本管理与效果对比报告,给出下一版迭代方向。
任职要求
1. 具备较大规模模型训练经验:有 27B 或以上规模模型的实际训练经验,能跑通完整训练闭环(不要求分布式训练框架开发能力)。 2. 深耕 RLVR / RLHF:深入理解并实践过 RLVR(可验证奖励强化学习)与 RLHF,理解 reward 设计、rubric 与训练效果之间的关系。 3. SFT / GRPO / DPO 经验丰厚:熟练掌握 SFT、GRPO、DPO 等训练方法,能根据任务选择合适的算法并调优。 4. 具备各类 reward 设计经验:有 dense reward(过程 / 分步奖励)、sparse reward(结果奖励)、process / outcome reward、reward shaping 与多目标加权等实际设计经验,能针对任务选对奖励形态并调出稳定可训练的 reward。 5. 具备 reward hacking 识别与改正能力:理解常见 hacking 模式与验证机制,能在训练过程中发现并修正。 6. 具备 Rubric 设计能力:熟悉主流 rubric 设计范式,能大批量生成高质量 rubric,并把主观评价拆成可校验子问题;熟练 Python,能独立完成数据处理、批量调用 LLM、结果聚合,读得懂训练框架与训练日志。 7. 具备评测集建设经验:有能力评测集 / benchmark 的设计与构建经验,能定义评测维度与判分协议、构造并维护评测样本(golden set),并用评测结果反查 reward、数据与模型能力短板,驱动评测体系持续迭代。 8. 有数据处理经验(数据清洗、筛选、增广、质量校验、pipeline 搭建)、熟悉 SFT / RFT / RL 各阶段数据需求差异者优先;有与领域专家协作、把专业判断转成可执行评分规则的能力,对数据分布 / 异常 / 偏见风险有敏锐直觉者优先。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。