AI Agent 安全不能只靠 Prompt 了:上海 AI Lab 探索 Agent 安全进化新范式
54 分钟前
大模型 Agent 进入多系统后,仅检查最终回复的安全评估方式覆盖面不足,风险可能出现在执行任一环节,安全修复也存在诸多难题。上海人工智能实验室联合多校提出 SHE 与 SafeEvolve 两项工作,推动 Agent 安全三步演进。SHE 将安全 Harness 拆解为四类组件,从完整执行轨迹出发诊断风险并针对性更新组件,经实验验证能有效降低攻击成功率、提升任务可用性,且安全边界可迁移。SafeEvolve 进一步将 Harness 经验转化为 Policy 模型自身决策能力,通过提炼 Safety Prompt 和分层 SkillBank,分 Harness-use SFT、Harness-augmented RL 两阶段训练模型,实验显示其能显著降低攻击成功率、提升任务效用。两项工作实现了从静态安全配置到轨迹驱动持续更新、从整体式规则到组件级责任划分、从单独更新 Harness 到 Harness 与 Policy 协同演化的转变,将安全推进为可根据执行经验持续修订的系统能力。
AI Agent 安全不能只靠 Prompt 了:上海 AI Lab 探索 Agent 安全进化新范式
机器之心/maomu.com/腾讯网
2026-09-15
上海市信息安全测评认证中心发布全国首个生成式人工智能安全测试公共服务平台2026-07-19
多份 AI 安全治理成果在上海集中发布2025-07-23
上海人工智能实验室推出多智能体框架 Intern・Agent体验专业版特色功能,拓展更丰富、更全面的相关内容。