大模型后训练质检策略研究(Agent方向)
关于这个机会
课题背景: 大模型后训练涵盖数据构造、SFT/RL训练、奖励与判别信号生成、效果验证等环节,任一环节的质量问题都可能被训练放大,影响模型能力与行为边界。当前质检多针对数据的单一静态语义信息,尚未结合训练动态等维度,亟需构建覆盖后训练全链路的质量度量体系。 课题挑战: 1)跨环节质量定义:统一刻画数据、Agent Trajectory、think-with-images、奖励信号、Rollout 过程及模型输出结果中的正确性、一致性、多样性与安全性问题;2)质量价值验证:建立质量问题与训练效果、能力提升及性能退化之间的关联,识别高影响问题并制定合理阈值;3)质检策略优化:融合规则、模型判定、分歧挖掘、人机协同标注(有标注人力)等能力,在成本可控的前提下降低误报与漏报;4) 数据价值模型: 训练离线数据价值判别模型降低外部模型调用成本;5)形成可持续回归、迭代和复用的质检闭环 具体工作: 梳理后训练各环节质量问题,建立分级标准与指标;研究人机协同的自动化质检方法;建设质检、复核、归因与回归 Pipeline,并在后训练任务中验证落地。
任职要求
1.计算机/软件工程等相关专业硕士以上学历,拥有博士学位者优先; 2.熟悉大语言模型或多模态理解模型数据领域的相关研究工作和算法,拥有发表顶会论文、大模型研究工作、知名竞赛获奖、顶级研究机构或一线互联网工作经验者优先; 3.熟练使用Python、PyTorch和CUDA等语言及工具,具备快速阅读和复现论文的能力,熟练使用AI工具 vibe coding提效者优先; 4.具备优秀的分析和解决问题能力,良好的团队合作精神及沟通意识。 5.有大模型数据研发相关公司的实践经验或者科研成果,有深入的 data insight,丰富的通过数据优化提升LLM&VLM效果经验者优先。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。