一个9B模型,在医疗研究Agent评测中拿到了79.6分。

这个数字比Claude Opus 4.6搭配Claude Code的77.5分还高2.1分。

它来自NVIDIA今年8月发布的Benchmark-as-Teacher(BaT)系统。论文标题直译过来就是"把基准测试当老师用"——听起来简单,但这套方法解决了一个困扰Agent训练很久的老问题。

标准训练把诊断信号当垃圾扔了

医疗影像研究的工作流很长:规划实验方案、搭建环境、验证数据、跑推理、提交结果。五个阶段,平均33轮工具调用。一个阶段出错,后面全白干。

现有的Agent评测系统已经能做到"阶段级诊断"——告诉你Agent到底栽在哪个环节。AutoMedBench就是这样一个基准,它对规划、搭建、验证、推理、提交五个阶段分别打分。

问题出在训练端。主流的GRPO方法给整条轨迹打一个总分,然后更新策略。33轮操作、五个阶段,一个分数根本说不清是哪一步没做好。更糟的是,训练流程把这些阶段级诊断信号直接丢弃了——下一轮训练开始时,系统不知道上次弱在哪里。

这就像体检报告写满了各项指标,但医生只看了一眼总分就把报告扔了。

考试卷变成错题本

BaT的核心思路是:让评测系统不只打分,还负责出题。

整个流程分两部分。第一部分是"Stage Bank"——一个异步数据管道。它不直接用评测里的真实题目训练(那叫泄露),而是根据公开的工作流描述,合成虚构的医疗影像任务。这些虚构任务按阶段边界切分,分成三个训练池:针对薄弱阶段的S-target、混合其他阶段的S-mix、以及端到端的E2E代理。

每个合成任务都经过泄露预检:检查是否混入了评测集的任务ID、答案、路径、报告等信息。只有干净的数据才能进入训练池。

第二部分是BiCuRL——双层课程强化学习。外层循环读取评测的阶段级分数,找出最弱的阶段,决定下一轮重点练什么;内层循环在对应的训练池里采样、执行、打分,用GRPO更新策略。更新后的模型送回评测,拿到新的阶段分数,循环再来。

*图:BaT的双层循环结构。评测信号驱动课程选择,训练数据与评测内容严格隔离。来源:arXiv:2608.16211*

9B模型翻了一倍多

效果很直接。

BaT-4B在AutoMedBench-Lite上的总分是Qwen Instruct基线的两倍以上。BaT-9B达到了79.6分,超过Claude Opus 4.6搭配Claude Code的77.5分。

在ABRA和MedXpertQA-Text两个外部评测上,BaT-9B分别拿到70.6和50.2分——和头部系统还有差距(79.9和65.0),但考虑到参数量级差异,这个距离已经说明方法论的有效性。

更有意思的是迁移测试。BaT-9B在三个推理任务上保持基线水平(差距3.4-5.8分),同时在SWE-bench Verified和Terminal Bench 2.0上有所提升。这意味着医疗领域的专项训练没有明显损害通用能力。

| 系统 | AutoMedBench-Lite | ABRA | MedXpertQA-Text |

|------|:---:|:---:|:---:|

| BaT-9B | 79.6 | 70.6 | 50.2 |

| Claude Opus 4.6 + Code | 77.5 | 79.9 | 65.0 |

| Qwen Instruct基线 | ~38 | — | — |

*数据来源:NVIDIA BaT论文 Table 1,arXiv:2608.16211*

关键不在分数,在方法

BaT的真正贡献不是刷了一个榜,而是证明了一个模式:评测可以成为训练基础设施,而不只是终点裁判

传统的Agent训练流程是"训练→评测→扔信号→再训练"。BaT把它改成"评测诊断→定向出题→训练→再评测"。评测的阶段级分数不只是诊断报告,还是课程表。

这个模式的前提是严格的内容隔离。如果训练数据里出现了评测集的原始内容,模型就是在背答案而不是学能力。Stage Bank的泄露预检保证了这一点——只有聚合统计信息跨过隔离边界,任务ID、答案、路径全部留在评测侧。

对于正在搭建长流程Agent的团队来说,BaT的思路可以直接借鉴:与其花力气做更大规模的端到端训练,不如把现有评测拆成阶段级信号,让系统知道哪里该多练。

源势AI观点

医疗Agent的训练困境其实是所有长流程Agent的共性问题——轨迹太长,一个总分说不清对错。BaT给出了一个干净的解法:让评测系统同时当教练,用阶段级诊断驱动课程学习。

这个思路的延伸价值在于:任何有结构化工作流的Agent场景——代码审查、法律文书、金融风控——都可以套用"评测即训练"的框架。关键约束是内容隔离,一旦训练数据泄露到评测集,整个循环就退化为背题。

NVIDIA选择医疗影像作为切入点很聪明:工作流阶段清晰、数据敏感度高(逼着你做隔离)、专家标注稀缺(逼着你做合成)。这些约束条件反而催生了更通用的方法论。

对于国内的医疗AI团队,BaT的Stage Bank模式值得关注。它不需要真实的专家轨迹数据,只需要公开的工作流描述就能合成训练数据——这在国内医疗数据合规环境下尤其有用。

---

来源标注

1. NVIDIA / UC Santa Cruz, "BaT: Towards Self-Evolving Medical Research Agent with Stage Rubrics", arXiv:2608.16211, 2026年8月17日

2. AutoMedBench-Lite评测数据,Liu et al., 2026a

3. MedAgentBench / HealthAgentBench框架,Jiang et al., 2025b