面向大模型数据处理的智能执行与超大规模调度关键技术研究
关于这个机会
课题背景 大模型数据处理涵盖文本、多模态、Embedding、质量评估、LLM/VLM 推理等多种 AI workload,并逐步进入 PB 级数据、万卡级 GPU 和复杂 Pipeline 协同生产阶段。现有数据处理、资源调度和运维体系相对割裂,需要构建统一、高效、智能化的数据基础设施。 课题挑战 面向 PB 级数据规模、万卡级异构算力和复杂 AI Data Pipeline,需要解决多类型 workload 统一抽象与执行、CPU/GPU 异构计算协同、超大规模 GPU 高吞吐调度、常驻与弹性资源协同、数据处理与模型推理混合负载优化等关键问题。同时,大规模生产环境下任务运行状态复杂、性能瓶颈动态变化,需要进一步解决执行计划自动优化、资源碎片治理、故障恢复、成本与性能联合优化,以及 Agent 对复杂数据系统的理解、诊断和自主优化能力,形成从数据处理、资源调度到智能运维的一体化技术体系。 具体方向(可以一个或多个) 1. 统一数据处理与执行框架 构建统一 Dataset 编程与执行体系,支持文本、多模态、Embedding、LLM/VLM 推理等任务,统一 Batch、Streaming、Incremental 等执行模式,并通过异构执行、流水线并行、算子融合和自动参数优化提升大规模数据处理效率。 2. 超大规模 GPU 调度与资源管理 面向主流分布式计算与 AI 基础设施,研究执行引擎、资源调度器和弹性伸缩机制,研究万卡级 GPU 的高吞吐调度、常驻卡与弹性卡协同、任务生命周期管理、资源碎片治理和负载感知调度,提升大规模 AI Data workload 下的算力利用效率。 3. Agentic Data Infra 与智能数据工程 构建面向 Agent 的 Data Infra Harness,打通系统知识、运行状态和执行接口,使 Agent 能够自主完成 Pipeline 生成、资源配置、运行诊断、故障修复和性能调优,形成 Plan—Execute—Observe—Optimize 的数据工程闭环。
任职要求
计算机、软件工程、高性能计算、分布式系统等相关专业硕士以上学历,拥有博士学位者优先; 熟悉大模型数据处理相关研究与工程工作,包括文本、多模态、Embedding、质量评估、去重、聚类、LLM/VLM 推理等场景;有大规模 Data Pipeline、数据处理框架或 AI Data Infra 经验者优先; 熟练使用 Python、C++、CUDA 等语言及工具,熟悉 Ray、Spark 等分布式数据处理框架,具备大规模 Shuffle、IO、CPU/GPU 异构计算、GPU 调度及性能优化能力;熟练使用 AI 工具及 vibe coding 提升研发效率者优先; 具备优秀的数据处理系统分析和复杂问题解决能力,能够从数据规模、计算、通信、存储、调度和资源利用率等维度定位 Pipeline 性能瓶颈;具备良好的团队合作精神及沟通意识; 有 PB 级大规模数据处理、万卡级 GPU 数据计算、Ray Data / Ray Core 源码优化、数据处理执行引擎或 Agentic Data Infra 等实践经验或科研成果者优先。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。