北京理工大学和深圳MSU-BIT大学的研究团队在arXiv上发了一篇论文(2608.09292),题目直指Agent自进化的核心困境:当Agent遇到超出自身能力的难题时,它采不到正确的行动轨迹,也就无法从错误中学习。

这不是工程问题,是方法论问题。现有的自进化方法依赖模型自己采样出正确轨迹来训练自己。但难题之所以是难题,正是因为模型采不到正确轨迹。

天花板是怎么来的

自进化的逻辑链条很简单:Agent执行任务→采集行动轨迹→筛选正确轨迹→用正确轨迹做监督微调→能力提升。这个循环在简单任务上运转良好,一旦任务难度超过模型当前能力,链条就断了。

论文用了一个概念叫"能力边界"(capability boundary)。模型在自己的能力边界内,有概率采样到正确轨迹,自进化可以运转。但超过这条线,采样到的全是错误轨迹,模型拿错误轨迹做训练数据,学不到任何有用的东西。

这跟我们在实际Agent落地中看到的现象一致。能源行业做智能研判,Agent在标准流程内表现不错,但遇到非标问题——比如异常工况的根因分析——就开始瞎猜。瞎猜产生的轨迹不能用来训练,因为它本身就不对。

零阶优化的思路

论文提出的解法叫"零阶自进化"(zeroth-order self-evolution)。核心思路是绕过"采样正确轨迹"这个前提。

具体做法分三步。第一步,对模型的LoRA参数做随机扰动。第二步,用扰动后的模型跑一遍任务,计算损失。第三步,用扰动前后的损失差来估计梯度方向——损失变小了,说明扰动方向是对的,往这个方向更新参数;损失变大了,就反方向更新。

零阶自进化方法对比

图:现有自进化方法 vs 零阶自进化方法的核心差异

零阶自进化三步流程

图:零阶优化的扰动-评估-更新三步流程

这个思路巧妙在哪?传统方法需要模型自己产出正确答案才能学习,零阶优化不需要。它只需要比较"扰动后比扰动前好还是差",就能获得优化信号。模型不需要知道正确答案长什么样,只需要知道哪个方向更接近正确答案。

HuggingFace上同期发表的SkillOpt-Lite论文(2607.03451)也走了类似路线:用零阶优化做技能优化,去掉冗余流程,用一行代码就能触发。两篇论文从不同角度验证了同一个判断:零阶优化是绕过能力边界的可行路径。

并行推理砍掉开销

零阶优化有个天然缺陷:需要对同一问题做多次扰动评估,计算量大。论文设计了一个并行扰动推理机制来解决这个问题。

LoRA的结构天然适合并行。LoRA把参数拆成两个小矩阵相乘,主干网络只算一次,多个扰动分支共享主干输出,各自计算轻量化的LoRA部分。这把多次前向传播的开销压到了接近一次。

论文还引入了自适应查表机制。Agent在执行任务时会调用工具,比如搜索。多次扰动评估同一个问题,容易产生相似的搜索请求。查表机制用一个共享池缓存最近的工具调用结果,语义匹配后直接复用,避免重复调用。

源势AI怎么看

我们在企业Agent落地中遇到过完全一样的瓶颈。金融行业做智能体风控,Agent在已知模式上表现稳定,但遇到新型欺诈手法——也就是超出能力边界的难题——就无法通过自我进化来应对。

这篇论文给了一个有价值的方向:不要求Agent自己想出正确答案,而是通过参数扰动探索"比现在更好的方向"。这比传统的监督微调更现实,因为它不依赖标注数据,也不依赖模型自身采样到正确轨迹。

但零阶优化也有它的代价。多次扰动评估意味着更多的推理次数,即使在并行优化后,计算开销仍然高于普通自进化。在企业场景中,这意味着更多的Token消耗和更长的迭代周期。我们的做法是把零阶优化放在离线训练环节,而不是在线推理环节——用更高成本的方法在训练阶段突破能力边界,用轻量化的模型在推理阶段保证效率。