DATA+AI 统一数据湖存储引擎
关于这个机会
课题背景: 数据湖已成为 AI 时代的基础设施,但传统湖仓架构在处理百亿级多模态数据(图片、向量、文本)时面临严峻挑战。当前核心痛点为:存储烟囱化(向量库与湖仓割裂)、计算效率低(JVM 内存开销与 RPC 损耗)、规模化成本高。随着湖仓存储 Native 技术的成熟,构建“AI-Aware”的统一存储引擎成为必然。本课题聚焦于高性能、原生统一的多模态湖仓引擎,通过内建向量搜索、原生去重与零拷贝技术,实现 Data 与 AI 的深度融合,大幅降低百亿级数据的处理成本与工程链路复杂度。 课题挑战: 1、超大规模下的存储效率与性能: 在处理千亿级图文去重等任务时,如何突破传统 HNSW 索引的“内存墙”,利用 DiskANN 与 IVF_PQ 技术实现磁盘级的高性能检索;如何通过 Native 内核优化,将存储引擎的吞吐提升至硬件极限,适配海量 AI 训练数据的高频读写需求; 2、多模态元数据统一与 Spec 演进: 如何打破向量、图片、结构化数据的存储边界,设计一套兼容 Iceberg 规范的统一元数据体系;如何确保多版本并发控制(MVCC)与 ACID 特性在百亿级分片下的稳定性,构建可解释、可追溯的 AI 数据资产库; 3、计算引擎与存储底座的零拷贝融合: 如何解决数据在存储引擎与计算,训练框架之间的搬运损耗;通过向量化执行引擎与 FFI 原生接口,实现存储层过滤(Pushdown)与 AI 算子的无缝集成,保障大规模去重与特征提取任务的效率。 具体工作: 你将结合前沿的湖仓一体架构与高性能计算技术,深度参与统一数据湖存储引擎的研发与落地,重点工作:优化湖仓存储内核, 例如Iceberg File Format API与AI-native格式适配。研发内建向量索引: 在湖仓内部设计并实现分布式向量索引构建方案,支持百亿级图文的快速去重与检索。设计多模态存储策略: 制定多模态数据(图片、Embedding、标签)的紧凑存储格式,优化冷热数据自动迁移。构建 AI 计算加速链路: 协助完成存储引擎与计算引擎,训练框架的 FFI 集成,实现算子下推与零拷贝数据读取。
任职要求
1、需要掌握高效的编码,压缩技术,针对不同的多模态数据,使用适合的编码和压缩进行存储; 2、需要掌握和实现一些高效的索引,根据不同的引擎访问模式,设计合适的索引,增强访问性能。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。