visual2code预训练数据构建范式研究
关于这个机会
课题背景: 现有多模态大模型的"视觉→代码"能力大多依赖蒸馏合成数据训练,图-码配对与真实工程实践中的原生代码分布严重脱节。这导致模型在复杂版式、深层结构与可执行可编辑性上普遍失真,难以把一张扁平截图真正还原为可渲染、可验证、可继续编辑的交付产物。这种能力缺口限制了其在AI For Working/Gaming等真实场景中的落地,阻碍了通用Visual2Code能力的演进。 课题挑战: 1)原生挖掘与渲染验证:真实原生的图-码配对散落在网页、开源仓库、PPTX与移动端安装包中,需跨SVG/PPT/Web/UI/图表等异构技术栈搭建可批量执行的渲染回环,代码重组成功率低、渲染环境依赖繁重,规模化极具挑战。 2)多样性度量与评测基准:不同topic的代码分属不同抽象层级与编程范式,同一视觉内容还会跨表示重复,需在视觉内容层重建多样性度量与配比口径;业界benchmark又普遍陈旧饱和、缺少对原生可执行代码的评估,需从零建立科学合理的评价体系。 具体工作: 构建覆盖SVG2Code、PPP2Code、Web2Code、UI2Code、Plot2Code、3D2code、CAD2code的超大规模原生图-码配对数据集并探索最佳配比;建设中间表示、渲染验证链路与资产库;重建多样性度量体系与Visual2Code综合评测基准;助力模型端到端实现从视觉输入到可执行、可编辑代码的生成。
任职要求
1.计算机/软件工程等相关专业硕士以上学历,拥有博士学位者优先; 2.熟悉计算机视觉、多模态领域的相关研究工作和算法,需要以第一作者身份发表多篇顶会论文,顶级研究机构或一线互联网工作经验加分; 3.熟练使用Python、PyTorch和CUDA等语言及工具,具备快速阅读和复现论文的能力; 4.具备优秀的分析和解决问题能力,良好的团队合作精神及沟通意识。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。