面向大模型的海量网页排重机制与高效索引技术研究
关于这个机会
课题背景: 网页数据是大语言模型预训练语料的核心来源,互联网中存在大量转载、镜像、模板克隆、局部改写、跨模态嵌套的动态 网页,产生海量完全重复、近似重复、语义重复页面。传统网页去重方案依赖HTML标签清洗、SimHash、MinHash、TF-IDF、句向量相似度等浅层特征,仅能捕捉表层文本重合,难以识别改写、语序调整、段落增删的语义近似网页;同时面对万亿级网页规模,存在特征存储开销大、增量更新效率低、长短文本区分能力不足等短板。 课题挑战: 一是网页广告、导航模板等噪声干扰大模型语义编码,现有方法忽略DOM结构信息,易造成误判;二是通用大模型嵌入难以区分全文复制、段落改写等多粒度重复模式;三是大模型推理成本高,无法支撑亿级网页流式实时处理;四是大模型输出的高维稠密向量缺少高效动态索引,海量网页持续新增场景下索引更新效率低;五是缺少细粒度标注评测基准,固定相似度阈值难以适配新闻、论坛等不同领域网页,重复判定准确率低。 具体工作: 研究网页结构化清洗与多粒度语义表征方法; 构建哈希粗筛加大模型精判的分层排重机制; 设计支持增量更新的高维向量高效索引; 搭建评测基准开展对比实验,验证排重后语料对大模型训练的优化效果。
任职要求
计算机、软件工程、高性能计算、分布式系统等相关专业硕士以上学历,拥有博士学位者优先; 熟悉大模型数据处理相关研究与工程工作,包括文本、多模态、Embedding、质量评估、去重、聚类、LLM/VLM 推理等场景;有大规模 Data Pipeline、数据处理框架或 AI Data Infra 经验者优先; 熟练使用 Python、C++、CUDA 等语言及工具,熟悉 Ray、Spark 等分布式数据处理框架,具备大规模 Shuffle、IO、CPU/GPU 异构计算、GPU 调度及性能优化能力;熟练使用 AI 工具及 vibe coding 提升研发效率者优先; 具备优秀的数据处理系统分析和复杂问题解决能力,能够从数据规模、计算、通信、存储、调度和资源利用率等维度定位 Pipeline 性能瓶颈;具备良好的团队合作精神及沟通意识; 有 PB 级大规模数据处理、万卡级 GPU 数据计算、Ray Data / Ray Core 源码优化、数据处理执行引擎或 Agentic Data Infra 等实践经验或科研成果者优先。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。