概要

训练一个会用工具的Agent,最贵的往往不是模型,而是环境。

每个工具调用都要有真实环境接住:数据库、API、客服系统、支付接口。想扩大训练规模,就得合成大量可执行环境,再逐一验证正确性。这笔账不好算:写工具、写状态管理、写验证逻辑,领域一扩,成本线性涨。论文里点名的几条代表路线都绕不开这件事:EnvScaler用程序合成工具交互环境,AWM搭带数据库状态的代码环境,ScaleEnv从零构建可交互环境和可验证任务,TOUCAN则从真实MCP环境里合成大规模轨迹。环境越复杂,验证越贵,最后还得靠真实环境兜底。

8月6日公开的EnvACE(arXiv:2608.06197,上海交大、浙大、新加坡国立、中大、腾讯等机构)换了个思路:不建环境,让模型自己演环境。

智能体通过工具和API与真实环境交互,环境的构建与验证是主要成本

图注:传统路线里,智能体靠真实环境或外部模拟器给出反馈。来源:EnvACE论文。

一个模型,两个角色

EnvACE的设计一句话能说清:训练时,模型先当"行动者",发出一个工具调用;接着切换成"环境",生成这个调用本该得到的响应;再基于自己排演出的响应,做下一步决策。

两个角色共用一套参数,用任务成功奖励端到端优化。训练只跑了470步,16张H20 GPU,用Qwen3-30B-A3B当裁判,每条轨迹最多30个交互轮。训练结束,"动作→环境响应"的关系被写进参数,变成一个随决策调用的世界模型。

之前也有工作让模型预测自己动作的后果,但只把它当辅助损失,决策时还是等外部给响应。EnvACE把排演直接嵌进决策链:下一步动作就建立在刚才排演出的响应上。外部模拟器则是另一回事,那是独立的模型,响应可能不准,校准还得回真实环境。

EnvACE概念图:同一模型既当行动者Act,又当环境World Rehearsal

图注:一个策略同时扮演行动者和环境。来源:EnvACE论文。

成绩说话

以Qwen3-8B为底座,EnvACE在四个智能体基准上超过了所有结果完整的环境扩展基线:

  • 三基准综合Overall 32.91%,高于EnvScaler-8B的31.92%和AWM-14B的32.54%;
  • τ2-Bench平均36.7%,比EnvScaler-8B、AWM-8B、AWM-14B分别高3.8、5.5、6.0个百分点,其中Airline域44.0%,比EnvScaler的34.5%高出近10个点;
  • BFCL V4拿到46.04%,比未训练的Qwen3-8B高2个百分点;
  • VitaBench 16.0%,是表中所有7B-8B方法里的最高分;
  • 金融工具调用基准FinMCP-Bench上,TF1 46.78%、工具精确率54.04%,均为表中最高,而EnvScaler的工具精确率只有39.18%。

拆开看子项,提升不靠单个基准拉动:τ2-Bench的Retail 48.9、Airline 44.0,都是表里前两名;BFCL多轮任务45.29,比未训练的Qwen3-8B高3.2个点。FinMCP上工具召回41.23%不是最高,EnvScaler做到49.35%,但EnvACE精确率54.04%对39.18%,调得更准,错调更少。

反面教材也有:用推理模型模拟环境反馈的Simulator-8B,综合分只有20.03,比没训练的Qwen3-4B还低。外部模拟这条路,响应一旦不准,训练就是往沟里带。

成本账也算得过来。EnvScaler、AWM、ScaleEnv的合成流水线,额外要代码工程和验证人力;EnvACE的额外开销只是轨迹里多生成一段排演响应,训练470步、16张H20就收尾。

规模扩展也成立。同一套配方从1.7B做到8B,BFCL V4平均提升14.23个百分点,τ2-Bench提升21.4个百分点,两个规模上都赢过标准GRPO。

还有个细节值得注意:把行动和排演拆给两个独立策略(Per-role Policy),τ2-Bench只有35.5%;共享参数后到36.7%。而标准GRPO不加排演,只有31.2%。也就是说,排演本身有用,排演和决策共用一套参数更有用——两个角色在互相喂数据。

执行前,先排练两遍

内化出的世界模型还有第二个用途:推理时先在脑子里排练几次,再真正动手。这接近人类的做法:外科医生上台前在脑子里过一遍流程,飞行员先在模拟器里飞一遍。区别是EnvACE的排练不需要模拟器,用参数就行。

排练次数N=2时,并行排练把Overall从36.7%提到40.9%,提升4.2个百分点;拆开看,τ2-Bench从31.4%到38.0%,BFCL多轮从41.9%到43.9%,全程没有额外的外部环境交互。串行模式也能到38.5%。N=3反而回落,排练预算不是越多越好。

对照实验更说明问题:用基座模型代替EnvACE来排练,并行模式提升微弱,串行模式甚至不如不排练。涨分不来自多烧推理算力,而来自训练时内化进参数的那份环境知识。

BFCL多轮任务上,EnvACE并行排练在N=2时得分最高,达43.88%

图注:排练次数与得分关系,EnvACE排练稳定优于基座模型排练。来源:EnvACE论文。

源势AI观点

我们在这篇论文里看到的是成本结构的转移:Agent训练的瓶颈,正从"环境供给"移向"模型自身的世界建模能力"。

这对企业落地是个实在的提醒。企业场景里最耗时间的往往不是调模型,而是搭沙箱、收拾试错成本:客服Agent在真实系统里错一步,就是一次投诉。如果Agent能先在自己的世界模型里排练,把明显错误的动作筛掉再执行,试错账单会小一个量级。

源势AI在能源、金融行业的Agent落地走的是类似路子:先建可验证的小闭环,让智能体在闭环里把错犯完,再放进真实环境,目前AI研判准确率做到98.7%,人力节省70%。EnvACE在训练层面给这条路加了个注脚:先排练、再行动,是能被奖励信号学会的。

论文只验证到8B规模,任务也以工具交互为主,更大模型上是否成立还是开放问题,作者自己也把这两点列为局限。但对做Agent工程的团队来说,有个问题已经可以排上日程:你的智能体,在执行前有没有一次便宜的排练机会。有,和没有,是两种工程。