优图实验室-多模态Code Agent 技术研究
关于这个机会
课题背景: 随着 Coding LLM 与多模态大模型的快速发展,Code Agent 正从单一文本驱动的代码补全工具,演进为能够理解多模态上下文(屏幕截图、设计稿、报错日志、终端输出、UI 渲染结果等)、自主调用工具、执行代码并根据反馈持续迭代的智能体系统。真实软件工程场景中,代码任务往往伴随丰富的视觉信息与运行时反馈——从需求文档、UI 设计稿到编译报错、页面渲染差异——这对模型的多模态理解、工具使用与自我纠错能力提出了全新挑战。本课题旨在探索原生多模态与 Code LLM 深度融合的 Agent 训练范式,构建具备多模态感知、自主决策与执行反馈闭环能力的下一代 Code Agent 基础模型。 课题挑战: 1、多模态代码上下文理解:如何让模型同时理解代码、终端/日志文本、UI 截图、设计稿等异构输入,建立视觉-代码-执行状态的统一表征; 2、工具调用与执行环境交互:如何设计高效稳定的 Agent-工具交互协议,使模型能够自主调用终端、编辑器、浏览器、调试器等工具完成复杂多步编码任务; 3、执行反馈驱动的自我迭代:如何构建"编写代码—执行—观察反馈(报错/渲染结果/测试用例)—修正"的闭环机制,并将执行反馈转化为可用于训练的奖励信号; 4、长程任务规划与状态管理:面对跨文件、多步骤的软件工程任务,如何让 Agent 具备稳定的任务分解、进度追踪与错误恢复能力,避免长序列执行中的目标漂移; 5、Agent 训练数据与奖励系统构建:如何规模化采集/合成真实编码轨迹(含多模态上下文与工具调用记录),并设计兼顾正确性、效率与代码质量的统一奖励体系。 具体工作: 你将参与多模态 Code Agent 基础模型的研发,包括但不限于:多模态代码理解与对齐算法研究、Agent-工具调用框架设计与优化、Renderer/Executor-in-the-Loop 强化学习训练、多模态编码轨迹数据构建与评测体系搭建等。
任职要求
1、计算机科学、人工智能、软件工程等相关专业的博士或优秀硕士; 2、深入理解多模态大模型与 Code LLM 技术路径,熟悉 ViT、VLM、Agent 框架、SFT/DPO/RL 等关键技术,在 NeurIPS、ICLR、ACL、ICSE 等顶会有相关研究成果者优先; 3、具备扎实的工程能力,精通 Python,熟悉至少一种主流深度学习框架(PyTorch 优先)及分布式训练技术;具备打通「代码—执行—反馈」闭环链路的工程经验者优先; 4、有 Coding Agent、GUI Agent、工具调用、Renderer/Executor-in-the-Loop 强化学习、代码大模型后训练等相关研究或实践经验者优先; 5、对技术有强烈的好奇心,具备解决复杂系统问题的韧性,以及出色的团队协作与沟通能力。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。