自我进化Agent是今年最热的叙事之一:Agent每做完一轮任务,把经验蒸馏成"技能"存起来,下一轮直接调用。不用动模型权重,能力像复利一样滚。
问题是,这笔复利一定是正的吗?
腾讯团队最近公开的论文《When Self-Evolution Backfires》(arXiv:2608.05810)给出了一个冷静的答案:不一定。过了某个临界点,越学越差。
倒U型曲线:技能积累不是单调的
实验在Terminal-Bench 2上做。Agent在沙箱容器里真实操作shell完成硬任务,对错由确定性校验器判定,不用LLM打分。
不设审查的对照组,把蒸馏出的技能全部写入技能池:pass@1从第1轮的48%爬到第3轮的62%,技能池从35条涨到105条,一切看起来都在变好。
然后崩了。第4轮52%,第5轮50%。技能池膨胀到179条,成绩却几乎退回第1轮的水平。
论文把第3轮的峰值叫"能力-污染拐点":拐点之前,新技能是资产;拐点之后,新技能是噪声。
图注:红线"学到什么收什么",第3轮见顶后回落;蓝线"先审查再入库",五轮单调上升到72%。
污染会遗传
为什么越学越差?论文把污染拆成三层:单个坏技能直接误导Agent;几条单独看都没问题的技能,注入到一起时互相打架;两层叠加,整条曲线就变成倒U型。
更麻烦的是污染的传播方式。第4轮蒸馏新技能时,参考材料里躺着第3轮的技能池——坏技能的错误逻辑会被后代技能继承,而后代技能里甚至不会提到它的名字。
论文里有个具体案例:一条关于git冲突处理的坏技能,在下一轮衍生出merge和rebase两条工作流技能;只删源头,这两条后代继续让7个git测试任务里的4个失败。
事后删除,救不回来
这是全文最反直觉的发现:污染在结构上不可逆。
数据很直观。从无审查组峰值62.3%跌到第5轮的50.0%,落差12.3个百分点。只删除8条问题源技能,恢复1.7个百分点;用开了上帝视角的"全谱系清理"(源头加所有后代一起删),恢复6.7个百分点——剩下5.6个百分点,永远锁在技能池的状态里。
换句话说,我们熟悉的"发现坏技能就删掉",基本是心理安慰。错误逻辑已经织进后代,删源头等于关了水龙头,但地上的水还在。
图注:12.3个百分点的跌幅里,只删源头恢复1.7,上帝视角清谱系恢复6.7,仍有5.6不可恢复;而事前审查的VaG直接站在72%。
门卫机制:入库之前先审查
既然事后补不回来,唯一的路是事前审查。论文的方案叫VaG(Verifier-as-Gatekeeper):每条新技能先落在Cold状态,只记录、对Agent不可见,想过两道门才能进运行时上下文。
第一门是三个视角不同的审查员:确定性的格式schema检查、在留出任务上的行为A/B回放、一次语义一致性审查(抓编造和自相矛盾的建议)。三者各抓一类问题,消融实验证明谁也不能替代谁。
第二门是组合审查:只有实测能提升组合表现的技能才准入,专门抓"单独无罪、合起来有罪"的冲突。
图注:同一批技能、两套制度。无门路径让污染逐轮扩散;VaG路径入库前验证,曲线单调上行。
结果:VaG从第1轮52%一路升到第5轮72%,单调不降;最终技能池只有37条,是无审查组179条的五分之一,成绩反而高出22个百分点。每个任务的token成本也更低:0.94M对1.19M。更少,更准,更便宜。
消融数据印证了每道门的价值:去掉行为回放,−10个百分点;去掉组合门,−8个百分点,池子还从37膨胀到58。
过了审查的技能,才带得走
还有一组数据值得看:VaG第5轮冻结的37条技能,不做任何再进化,直接换骨干模型用——GPT-5.4、Claude Sonnet 4.5、DeepSeek-V4-Pro、Qwen3.6-35B-A3B,全部正提升,+8到+16个百分点。
这说明过了门的技能编码的是与模型无关的通用工程经验,而不是某次运行的过拟合产物。无审查组的179条技能,靠的是数量,不是质量。
源势AI观点:经验不是天然资产
做企业Agent落地,我们常听到同一种直觉:让Agent自己攒经验,让知识库自己长,存下来的就是赚到的。这篇论文用数据提醒:未经审查的经验不是资产,是负债,而且这笔负债也滚复利。
源势AI在能源、金融等行业的Agent落地中,把审查门写进了流程:进入决策上下文的经验条目,要过案例回放和业务校验。我们对外公布的AI研判准确率98.7%,靠的是这种准入管理,不是经验堆得多。
技能库、知识库、提示词库,道理相通。写入的那一刻最便宜,删除的那一刻最贵。
Agent越学越多之后,真正的问题不是它学到了什么,而是谁在审查它学到的东西。