一个Agent跑了10轮对话才完成任务。哪一轮最关键?哪一轮搞砸了?

没人说得清。

这不是管理问题,是训练问题。当前主流的Agent训练方法——GRPO——给整条轨迹打一个总分,然后均匀分配给所有token。10轮对话、50步操作,一个奖励信号平均分摊。成功的轮次和失败的轮次拿到同样的强化信号。

浙江大学和蚂蚁集团8月提出的CREST框架,第一次把这个账算明白了。

一条轨迹的分数说不清对错

举个具体例子。一个Agent在前5轮正确地搜集了所有信息,但在第6轮选错了工具,后面4轮基于错误数据继续操作,最终失败。

GRPO看到的是:轨迹失败,奖励为0。然后这个0被均匀分配给所有10轮的所有token。前5轮做对的token也拿到了负信号——它们被"惩罚"了,尽管它们做的事情是对的。

反过来也一样。一个Agent前8轮稀里糊涂,但最后两轮误打误撞完成了任务,拿到正奖励。那8轮的错误操作反而被强化了。

在WildToolBench上,这个问题尤其明显:没有任何模型的会话级准确率超过15%。轮数越多,表现越差。原因就是这个信用分配问题——奖励信号被稀释、被错位、被混淆。

两层解法:先分轮,再分token

CREST的思路是把信用分配拆成两层。

第一层:轮间信用。 把一条轨迹按轮次切分,每一轮独立打分。第6轮选错工具导致后续全崩?那负信号集中在第6轮及以后。前5轮搜集的信息被正确使用?那正信号保留在前5轮。

这一步的实现很直接:用验证器(verifier)对每一轮的中间结果做检查,然后计算turn-segmented advantage。验证器只看结果对不对,不看模型怎么想的——所以性能上限由验证器质量决定,不会被外部教师限制。

第二层:轮内信用。 在同一轮内部,哪些token更重要?CREST用了一个巧妙的机制:熵门控自教师(entropy-gated self-teacher)。

具体来说,对于模型很确定的token(低熵),不需要太多梯度信号——模型已经知道怎么做。对于模型犹豫的token(高熵),才是真正需要学习的地方。CREST用模型自身的一个特权版本(看到正确答案后的自己)来提供token级指导,但只在高熵区域施加影响。

*图:三种信用分配策略对比。GRPO(上)对全轨迹均匀分配;OPSD(中)有密集信号但集中在格式token;CREST(下)正确区分轮次并在高熵token上集中梯度。来源:arXiv:2608.13179*

这两层是互补的。论文消融实验显示,任何一层单独使用都无法恢复完整性能。

教师定方向,学生调幅度

CREST的论文副标题很有意思:"Teach the Magnitude, Not the Direction"——教幅度,不教方向。

这是什么意思?

在策略优化中,"方向"指的是梯度更新朝哪个方向走,"幅度"指的是走多远。CREST让验证器决定方向(该强化还是抑制这个行为),让自教师决定幅度(这个token需要多大程度的调整)。

这样做的好处是:学生的能力上限由验证器决定,不会被教师的能力封顶。传统的在线蒸馏方法(OPSD)有一个致命问题——学生的表现不可能超过教师。CREST绕过了这个限制,因为教师只负责微调幅度,不负责指出大方向。

在BFCL V3和WildToolBench两个基准上,CREST在两种模型规模上都超过了RL和蒸馏的基线。在长轨迹和严格的会话级指标上,提升幅度尤其明显。

| 方法 | BFCL V3 | WildToolBench(会话级)|

|------|:---:|:---:|

| GRPO基线 | 基准 | <15% |

| OPSD蒸馏 | 教师封顶 | 教师封顶 |

| CREST | 显著提升 | 显著提升 |

*数据来源:arXiv:2608.13179 Table 2-3,浙大/蚂蚁集团,2026年8月*

对Agent工程的意义

CREST解决的不仅是训练问题,也是调试问题。

当你有一个跑了很多轮的Agent,CREST的轮间信用分配可以直接用来诊断:哪一轮的advantage最低?那一轮做了什么操作?这个诊断信息比"整体成功率85%"有用得多。

对于做Agent产品的团队,这意味着:

1. 失败定位更精准:不再需要人工回看几十轮对话来找bug

2. 训练效率更高:弱轮次得到更多练习,强轮次不被过度训练

3. 性能天花板更高:不受教师模型能力限制

源势AI观点

信用分配是Agent训练的隐形瓶颈。大家都在卷模型规模、卷数据量、卷工具数量,但很少有人认真解决"哪一步做对了"这个基础问题。

CREST的方法论其实很通用:先按业务逻辑切分阶段,再在每个阶段内找关键决策点。这个思路不只适用于训练,也适用于Agent运行时的自我反思——如果Agent能自己判断"刚才那一步是不是关键步骤",它就能在出错时及时回滚,而不是带着错误继续往前走。

值得注意的是CREST和前一天发布的BaT(NVIDIA)的互补关系。BaT用评测的阶段分数做课程学习,CREST用验证器的轮间分数做信用分配。两者都指向同一个方向:长轨迹Agent需要结构化反馈,不能只靠一个总分。

---

来源标注

1. 浙江大学/蚂蚁集团, "CREST: Verifier-Bounded Credit Assignment for Multi-Turn LLM Agents", arXiv:2608.13179, 2026年8月13日

2. WildToolBench评测数据,Laban et al., 2025

3. BFCL V3基准,Berkeley Function Calling Leaderboard