腾讯
校园招聘 · 青云计划-应届生大语言模型数据质量优化与数据实验
面议
关于这个机会
课题背景 大语言模型的预训练数据集优化是持续性的工作,包括对海量网页、文档、代码数据的通用改造、低质清洗、优质数据筛选、数据多样性分布优化等工作。 课题挑战 本课题需要实习生对数据质量有非常深刻的理解,包括单样本质量、数据集整体多样性/分布等,并且能创新性地引入或优化大语言模型数据处理过程中前沿的NLP算法,如语义去重、聚类、质量分类模型等,结合实验验证,持续优化千亿数据的质量 具体工作 本课题需要实习生在以上1~2个方向上,能引入创新性的算法优化,对大语言模型数据的处理能带来数据效果上显著的提升,最终数据算法落地到混元LLM正式版本的数据生产中,带来实际的线上效果提升。
任职要求
1.计算机/软件工程等相关专业硕士以上学历,拥有博士学位者优先; 2.熟悉大语言模型领域的相关研究工作和算法,拥有发表顶会论文、大模型研究工作、知名竞赛获奖、顶级研究机构或一线互联网工作经验者优先; 3.熟练使用Python、PyTorch和CUDA等语言及工具,具备快速阅读和复现论文的能力,熟练使用AI工具提效者优先; 4.具备优秀的分析和解决问题能力,良好的团队合作精神及沟通意识。 5.有大模型数据研发相关公司的实践经验或者科研成果,有丰富的通过数据优化提升LLM效果经验者优先。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。