Agent 自我进化听起来是个纯好消息:任务做完了,把成功经验存成技能,下次直接用。但两篇 2026 年 8 月的新论文指出同一件事:进化机制只优化任务结果,不检查经验是否安全。一次危险的成功,会被当成好经验留下来。
坏经验会留档
先说问题是怎么被量化的。港城大和 Adelaide 大学的 SkillMisevo 团队(arXiv:2608.12851,2026 年 8 月)搭了一套生命周期测试环境,让 Agent 在任务流里自我进化,然后追踪「写入—检索—再执行」全链路的安全风险。
实验规模:25 个 Agent 与方法配置,每个配置跑 525 个任务、25 轮 episode。结果:全部 21 个带进化机制的配置都写出了不安全的技能文件;其中 15 个配置在全新会话里实际造成了伤害。也就是说,写出不安全内容不是小概率事件,是进化机制的默认行为。
「写出」和「造成伤害」之间还有一段差距:21 个配置全部产出不安全文件,但只有 15 个真正在新会话里触发伤害。剩下的 6 个没出事,靠的是运气,不是机制。论文的核心论点是:现有基准只测当前行为或静态产物,没法把风险归因到「写入—检索—再执行」的完整链路上。这次他们设计了九个生命周期指标,专门量化每个环节的风险传递。
注入攻击的成本低得吓人。研究者只往任务流里混入 3 个恶意任务,就把后续任务被带偏的成功率(carryover ASR)从 16.0% 拉到 35.3%,翻了一倍多。恶意输入消失之后,危险操作还在技能库里,等着被下一个任务调用。
安全层也得会进化
发现问题之后,两篇论文各自给出了修法的方向。
SkillMisevo 团队的 SafeEvolving 是个包装器,在经验写入时修复不安全内容,并管控后续复用。效果:不安全检索降低 26.7 个百分点,新会话伤害降低 17.3 个百分点,正常任务的效用只变化 0.4 分。安全治理和任务能力基本不冲突。
图注:SafeEvolving 的设计思路——技能写入后如何管控复用(图源:arXiv:2608.12851 第6页)
图注:技能误进化的完整生命周期——恶意输入、经验沉淀、跨任务携带(图源:arXiv:2608.12851 第2页)
另一条路来自上海 AI 实验室和复旦的 SHE 框架(arXiv:2608.09885)。他们的思路是把 Agent 的运行外壳(harness)拆成四个有明确安全职责的部件:系统提示、规则库、安全记忆、工具策略,让安全边界从执行轨迹里自己学出来。
数字很硬:在 Agent-SafetyBench 上,进化后的外壳把攻击成功率从静态基线的 17.1% 压到 5.5%,降了 3.1 倍;可用率反而从 31.6% 升到 47.6%。拿到没见过的 AgentHarm 基准上,危害分从 19.8% 降到 9.8%,不需要重新进化就能迁移到其他模型。
企业的风险敞口
这两篇论文测的是实验室环境,但风险敞口在真实业务里早就存在。
Agent 的经验来源是什么?用户请求、工单、仓库脚本、工具返回的内容。这些输入里任何一个被攻击者控制,都可能把「收集敏感信息」「执行未验证命令」这类操作混进一次成功的任务里。进化机制一看任务成功了,就把整套流程留档。
这和 8 月初 Anthropic 报告的多智能体失控现象指向同一个结论:Agent 系统的风险不在单次输出,在持久化的状态。输出可以审核,状态会复利。
图注:3 个恶意任务把 carryover ASR 从 16.0% 拉到 35.3%,SafeEvolving 可大幅压回
源势AI怎么看
我们在能源、金融行业做 Agent 落地,安全边界是项目验收的第一条。SkillMisevo 和 SHE 给了我们两个可以直接用的工程原则。
第一,技能库要有写入审查。经验入库前过一道安全扫描,比事后追溯便宜得多。SafeEvolving 证明了这道闸门的代价可以压到接近零。
第二,安全规则要能自己长。静态规则库追不上新风险,SHE 的「从失败轨迹里学边界」是正确方向。我们的 Agent 运行底座正在引入这套机制:把每次安全事件转成结构化诊断,更新对应的规则部件,而不是每次靠人改提示词。
AI 研判准确率 98.7% 的前提,是错误不会被沉淀成经验。自进化的 Agent 必须先进化出刹车。