← 发现更多职位
字节跳动
社招 · 正式

AI数据平台开发工程师-Seed

面议
Beijing(北京) · 经验要求见详情
研发后端社招 · 正式A67809A

关于这个机会

团队介绍:字节跳动Seed团队成立于2023年,致力于寻找通用智能的新方法,追求智能上限,为科技和社会发展作出贡献。 Seed团队在AI领域拥有长期愿景与决心,团队研究方向涵盖MLLM、GenMedia、AI for Science、机器人等,在中国、新加坡、美国等地设有实验室和岗位。目前,团队已推出业界领先的通用大模型以及前沿的多模态能力,支持豆包、即梦、TRAE等超过50个应用场景,并通过火山引擎开放给企业客户。第三方数据显示,豆包App用户量在中国市场排名第一,豆包大模型日均Token调用量行业领先。 1、负责&参与Seed大模型训练的多模态数据平台架构演进以及推进落地,根据不同领域场景大模型落地需求,提出大模型训练和优化数据规模、数据类型、数据结构等建议; 2、负责&参与搭建多模态数据平台,支撑大模型数据的存储、预处理(去重、相似度计算、脱敏等)、可视化&分析、数据离在线打标和人工标注诉求,并且针对多模态数据场景、数据类型、数据规模有足够的扩展性,以支撑大模型数据集持续迭代,实现高质量数据集沉淀,从数据中挖掘出影响模型训练结果的可能因素,从而帮助模型训练改进;同时降低数据的获取门槛,提升数据的使用价值; 3、负责千亿级别海量多模态数据的管理,包括视频、图像数据的存储,数据处理,数据安全,数据校验等等; 4、负责多模态数据链路基建的研发,追求极致的处理速度,达到百万QPS的处理能力; 5、与Seed算法同学深度合作,加速训练数据的获取,提升数据质量,支持模型结果数据评测,打造数据闭环。

任职要求

1、计算机、人工智能等专业,硕士学位及以上,具备3年以上数据处理或模型训练工作经验; 2、精通Python、Java等至少一种编程语言,具备良好的编码能力和代码质量意识;熟悉常用的数据处理、文本处理和图像处理库,能够高效地实现数据清洗和处理的算法和流程; 3、具备丰富的数据建模以及数据架构经验,能够对结构化和非结构化数据场景进行统一的建模; 4、熟悉Hive,ClickHouse,MySQL、MongoDB、ES等数据湖和数据仓库,了解底层原理,具备数据抽象和建模的能力; 5、熟悉Hadoop、Spark,Flink,Ray等大数据处理的相关经验; 6、具备出色的沟通和协作能力,注重细节、善于分析问题并解决问题。 优先: 1、主导过大模型或者离在线场景下的数据平台建设、海量的多模态数据平台建设、大数据开源框架者。

官方来源与核验

字节跳动官方招聘 · 职位编号 7548305551928609032

官方发布时间:

最近核验:2026-09-16T12:33:12.416632+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。