Agent 底线与执行安全评估研究
关于这个机会
课题背景: Agent 获得工具权限后,风险从"说错话"变成"做错事"。最新研究显示主流模型在可执行红队基准上宏平均攻 击成功率超过六成,且近五分之一的实际违规发生在 Agent 已经明确说出相关约束之后,暴露出认知与执行之间的鸿沟。同时提示注入连续两年位居 OWASP 大模型风险首位,监管侧也已将对抗测试文档化列为合规要求。 课题挑战: 第一,安全评测测的是最坏情况而非平均水平,采样策略、指标定义和统计方法都与能力评测完全不同。第二,单一攻 击成功率会把暴露、执行、观测和判定四件事混在一起,需要沙箱内的状态级证据来确认真实危害是否发生,而不是看模型说了什么。第三,风险是轨迹级现象,危险路径可能在逐步执行中形成,单轮拒答测试完全看不见。第四,Agent 会因察觉自己正在被评测而改变行为,评测环境的隐蔽性成为方法学难题。第五,公开攻 击集会被快速拟合,必须持续产出私有对抗样本,对团队持续产能提出很高要求。 具体工作: 负责 Agent 安全评测体系建设,构建可执行沙箱与轨迹级红队方法,建立危害判定与证据链标准,输出风险画像并支撑发布准入决策。
任职要求
学历和专业: 网络安全、人工智能安全、计算机系统、机器学习等相关专业,有红队攻防、对抗鲁棒性或安全评测研究经历者优先。 技术技能: 熟悉提示注入与越狱攻 击方法,掌握 Agent 沙箱与权限隔离技术,具备自动化攻 击生成与轨迹分析能力,精通 Python,了解相关合规框架要求。 软性素质: 具备攻 击者视角与防守者责任感,能在业务压力下坚持安全底线;与法务、合规和产品团队协作顺畅;对新型风险保持高度敏感和主动性。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。