大规模异构计算引擎
关于这个机会
课题背景: 高质量数据是大模型效果的基石,数据处理与清洗阶段占据了模型研发周期的大量时间。当前主流大数据计算引擎(如Spark/Hadoop)主要基于CPU架构,面对大模型训练所需的PB级数据与复杂的多模态清洗逻辑,现有架构存在吞吐量低、延迟高、资源利用率瓶颈等核心痛点,难以匹配GPU训练集群的高效节奏,形成了“训练快、清洗慢”的数据供给断层。GPU异构算力具备强大的并行计算能力,为突破数据处理性能瓶颈提供了新路径,可实现数据清洗与特征处理的百倍加速。因此,本课题聚焦于构建大规模异构计算引擎,旨在将传统CPU负载繁重的数据清洗、Tokenization、向量化等任务卸载至GPU,利用GPU的高并发与高带宽优势,实现数据处理链路的百倍加速,构建“ETL-Training”全链路GPU化的下一代AI基础设施。 课题挑战: 1、显存受限下的海量数据吞吐优化: GPU显存容量远小于CPU内存,如何在处理PB级大模型数据时,设计高效的内存管理机制与数据落盘策略;解决GPU显存碎片化问题,在保证高吞吐的同时避免OOM; 2、计算卸载策略与CPU-GPU协同调度:并非所有任务都适合GPU执行。如何构建智能的计算卸载策略,精准识别可加速的数据清洗任务,优化CPU与GPU之间的数据传输开销(PCIe瓶颈),实现“CPU控制逻辑+GPU密集计算”的高效协同,避免数据搬运抵消性能收益,是提升引擎效率的关键; 3、大规模分布式扩展与容错机制: 大模型数据处理依赖千卡级集群,如何将单机GPU加速扩展为分布式异构计算集群,解决异构环境下的资源隔离、任务调度与负载均衡问题;同时构建适配GPU计算特点的容错与检查点机制,保障海量数据处理的稳定性与一致性。 具体工作: 你将结合前沿异构计算与大数据处理技术,参与大规模异构计算引擎的研发与落地,重点工作:设计支持GPU加速的数据算子库与执行引擎;构建分布式异构数据处理管道,优化多模态数据吞吐性能;设计引擎在大规模集群上的部署与性能评估方案;协助完成引擎与现有大模型数据生产流程的融合验证,大幅提升数据清洗效率,降低计算成本。
任职要求
面对超大规模计算带来的挑战需要很好的研究和落地能力,需要熟悉内核代码,大规模分布式异构计算的知识。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。