腾讯
校园招聘 · 青云计划-应届生下一代大语言模型主要预训练数据提升空间
面议
关于这个机会
课题背景 当前业界大语言模型预训练阶段主要采用来自网页、文档、代码等互联网上的公开数据,经过精心解析、清洗、质量筛选后,结合模型训练效果构建成最佳的预训练数据集合;但公开研究较少提及诸如多模态数据、非公开域可直接抓取的数据在LLM预训练时对模型的价值。 课题挑战 本课题偏数据前瞻性探索,需要实习生在充分了解当前业界常用的文本预训练数据源、加工方式、模型效果的基础上,创新性地探索更大范围的数据源对应的价值, 具体工作 涉及的工作包括新数据集原型的构建,数据集质量优化,数据实验验证价值等。
任职要求
1.计算机/软件工程等相关专业硕士以上学历,拥有博士学位者优先; 2.熟悉大语言模型领域的相关研究工作和算法,拥有发表顶会论文、大模型研究工作、知名竞赛获奖、顶级研究机构或一线互联网工作经验者优先; 3.熟练使用Python、PyTorch和CUDA等语言及工具,具备快速阅读和复现论文的能力,熟练使用AI工具提效者优先; 4.具备优秀的分析和解决问题能力,良好的团队合作精神及沟通意识。 5.有大模型数据研发相关公司的实践经验或者科研成果,有丰富的通过数据优化提升LLM效果经验者优先。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。