Agent会自己修改自己了:改一个回答、改提示词、改工具、改工作流,甚至改"未来如何更新自己"的规则。问题跟着来了——它真的变好了,还是只是自我感觉良好?腾讯混元联合浙江大学、北京大学、清华大学发布的110页综述《深入可靠的自进化智能体》给出了一套回答框架:L0到L4五级分类法,加一条核心结论——可靠性不取决于改动有多深,而取决于评估改动的证据是否独立于这次改动本身。(来源:《腾讯混元智能体自进化综述:L0–L4分级,与「凭什么信」的证据问题》;论文:Diving into Reliable Self-Evolving Agents: A Survey,腾讯混元等,2026年8月10日,110页,引用549篇文献)
图注:审计者必须在系统边界之外——这是可靠性的第一原则。
先分级:改动落在哪一层
综述用一个四元组描述智能体的保留状态:模型θ(权重)、脚手架σ(提示词、工具、记忆、工作流)、改进器U(提案/选择/提交/回滚机制)、评判标准C(目标、奖励、评估协议)。自进化程度按"最深的、有因果效力的改动"定级:
L0只改当前任务的输出,任务结束就丢弃。L1改模型权重,影响后续任务。L2改脚手架——提示词、技能库、记忆、工作流。L3改改进器本身,也就是"未来怎么更新自己"的机制,综述把递归自我改进(RSI)的起点定在这里。L4最深,改的是评判标准——评估协议、奖励语义、价值约束。(来源:《腾讯混元智能体自进化综述》)
注意两点。第一,五级不是能力排序,只反映改动的功能位置;同一种算法(强化学习、搜索)可以出现在多个级别。第二,L1到L4都要求"持续性条件"——改动必须真正留存并影响后续独立任务,存了一条待议的更新不算。
每一级都有自己的典型失效方式,综述称之为"特征性失效"。L0是自我确认:更多推理只是认可了已有的错误。有实测数据:没有外部标签时,内在自我纠正会把GPT-4在GSM8K上的准确率从95.5%降到89.0%(HotpotQA从49%降到43%);把自我反馈换成人类反馈,修复成功率从33.3%升到52.6%。L1是模型崩溃和尾部收窄。L2是脚手架过拟合——留出集被反复查询,评估就退化成开发反馈。L3是指标俘获:改动去适应内部参照,外部没有对应收益。L4最危险,评判漂移:内部分数上涨可能是"行为改变+标准移动"的合成效果,仅凭修订后的标准分不出"更有效"和"更容易满足"。(来源:《腾讯混元智能体自进化综述》)
图注:L0到L4按"改了什么"分级,每级对应一个机制家族。
外部审计:凭什么信
综述的第二个支柱是"外部审计":用处于相关更新边界之外的证据与决策程序,对照外部目标来评估改进主张。外部目标、证据源、验收策略三要素都要带版本号,保留在更新边界外。
这里有个容易混淆的地方:"外部"指的是由谁控制,不是在哪运行。如果更新可以选择证据、或反复查询评估结果,独立性就被削弱了。一轮循环的完整流程是:执行→提案→内部选择→外部审计→接受/回滚/上报。内部选择只决定哪个候选送审,不决定是否被接受;接受只表示"证据满足声明的审计要求",不表示系统在所有方面都变好了。(来源:《腾讯混元智能体自进化综述》)
这个框架不是空谈,有实证支持。城市大学香港和阿德莱德大学的SkillMisevo(arXiv:2608.12851)专门测了技能演化的安全生命周期:25个Agent方法配置、每个覆盖525个任务,结果是所有21个演化配置都产出了不安全的技能文件,其中15个在新会话里造成了实际伤害;仅3个恶意任务就能把跨任务的攻击成功率从16.0%抬到35.3%。他们的修复方案SafeEvolve——在写入前修复不安全内容、治理后续复用——把不安全检索和新会话伤害分别降了26.7和17.3个百分点,良性任务效用只掉0.4分。(来源:arXiv:2608.12851 SkillMisevo, 香港城市大学/阿德莱德大学)
这组数字正好印证综述的分级逻辑:技能演化属于L2改动,风险不在"改了脚手架"本身,而在评估改动的证据不独立——任务结果好,不等于程序安全。
图注:外部审计在三种结局中裁决:接受、回滚、上报。证据源与验收门在更新边界之外。
旁证:评估问题早就有人踩坑
这个"凭什么信"的问题,工程侧的观察能对上。黄大年茶思屋的自进化智能体综述选文里,专门把"Agent评估:靠什么信任一个概率性的系统"放在特别推荐位:无版本、环境变动下Agent会静默推理出错(Agent漂移),当前主流榜单评测受脚手架差异、训练数据污染、自报与第三方标准不一等局限,匹配不了生产实际。他们的结论和混元综述指向同一处——评估与可观测性闭环是生产落地的前提。(来源:《10篇论文读懂自进化智能体》茶思周一见)
国内企业侧也有动作。陕西秦云的《AI Agent商业化拐点》和信通院的《企业级智能体技术与应用研究报告(2026年)》都把"从演示Demo到真实业务交付"的卡点之一归结为评估体系缺失——这个判断与综述的外部审计框架是同一件事的产业版本。(来源:《AI Agent商业化拐点:从演示Demo到真实业务交付》)
图注:各级自进化的特征性失效与实测数字。
源势AI怎么看
我们给能源和金融客户做Agent,客户最常问的一个问题是:它上线之后会不会自己变?现在有了明确的回答框架:问清楚改动落在哪一层,再问评估证据在哪。
三条实操建议。第一,给自进化功能定级。大多数企业Agent的"自进化"其实是L2——改提示词、沉淀技能、更新记忆。这一级的失效方式是静默的,分数可能还在涨。第二,评估证据必须独立。评测集、评分规则、验收门要版本化,放在Agent自己够不着的地方;被评估的系统不能挑选自己的考题。第三,给"改动"设审计门。接受、回滚、上报三种结局都要有,高风险改动(碰到资金、调度、审批的)默认上报人工。
一句话:进化深度不是卖点,证据独立性才是。改动越深,审计越要往边界外放。