← 发现更多职位
腾讯
校园招聘 · 青云计划-实习生

元宝—多模态模型安全边界的可解释性研究与Agent应用探索

面议
北京 · 经验要求见详情
青云课题青云计划-实习生CSIG

关于这个机会

课题背景: 大模型在国旗绘制、地图生成、地理边界表达等高精度场景中,常因能力不足产生错误输出,引发安全风险。当前主要以直接拒答应对,但"一刀切"策略导致用户无法区分是安全限制还是能力不足,降低了系统可理解性与信任度。随着模型向多模态Agent演进,Agent需进行多步规划与工具调用,若无法清晰解释失败原因与能力边界,将进一步影响可控性与用户体验。本课题研究各类场景可复用的安全边界可解释机制,在保障安全的同时提升交互可信度。 课题挑战: 1、能力边界与安全策略难以区分:如何判别"因安全策略拒绝"与"因能力不足无法完成",避免处置策略混淆。模型失败可能源于数据缺失、Prompt理解偏差、生成不稳定或工具链路不可靠等多种因素,需建立系统化的归因框架; 2、解释机制设计:敏感场景中完全拒答影响可用性,直接放开又存在风险,需找到合理平衡点。生成清晰、准确且易理解的反馈,既要有足够信息量,又不能过于复杂; 3、从基座到Agent的迁移:文生图"生成失败"与Agent"执行失败"形式不同,需验证边界判别与解释机制在多步任务中的有效性。 具体工作: 1、场景挖掘与测试集建设:基于文生图Badcase,梳理国旗、地图等典型风险场景,构建能力边界测试集与分类体系; 2、风险归因分析:判断Badcase来源(数据缺失/Prompt偏差/生成不足/策略误判),建立"能力不足"与"违规内容"的判别依据; 3、基座模型能力优化:针对高频边界场景,通过SFT/LoRA等轻量方法提升生成稳定性,从源头减少风险输出与不必要拒答; 4、可解释拒答机制:设计区分"安全限制"与"能力限制"的判别模块,替代统一拒答,提供透明的限制原因说明; 5、Agent场景迁移:将"边界识别—解释反馈—替代引导"机制迁移至Agent的任务执行失败、工具调用受限等场景。

任职要求

1、包括但不限于计算机科学与技术、信息工程、模式识别、人工智能、自动化、软件工程、电子工程、统计学、应用数学、物理学/量子计算、信息安全、信号与信息处理等相关方向的优秀博士/硕士同学; 2、熟练掌握计算机视觉、图像处理相关基础算法与应用,了解深度学习基本原理;熟悉 Transformer 架构,了解文生图模型(如 Diffusion)或多模态模型的基本原理与常见方法; 3、熟悉 Caffe、TensorFlow、PyTorch 等至少一种深度学习框架;具备较强的工程实现能力,熟练掌握 C/C++ 编程,熟悉 Shell、Python、Matlab 中至少一种编程语言; 4、具备一定的数据分析能力,能够从模型 Badcase 中挖掘规律、定位问题,并辅助完成能力边界分析、风险归因与效果评估; 5、对大模型安全、对齐(Alignment)、多模态理解生成、人机交互(HCI)等方向有较强兴趣,具备良好的问题抽象与研究探索能力; 6、加分项:了解 Agent 框架或相关应用实践经验者优先,例如 LangChain、AutoGPT 等;有多模态大模型、安全对齐、生成模型优化或相关项目经验者优先。

官方来源与核验

腾讯官方招聘 · 职位编号 1233535296004810752

最近核验:2026-09-16T14:46:00.874288+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。