NVIDIA在8月中旬发布了BaT(Benchmark-as-Teacher),一个让医疗AI Agent通过"考试反馈"来自我进化的系统。核心发现是:9B参数的BaT Agent在AutoMedBench-Lite上得分79.6,超过了Claude Opus 4.6配Claude Code的77.5分。
一个小模型打赢了大模型。它靠的不是更多参数,而是把评测标准变成了训练信号。
医疗Agent的特殊困难
医疗AI Agent的工作流是多阶段的:先制定计划,再配置工具,然后验证数据,接着执行推理,最后提交经过检查的结果。任何一个阶段出错,后续所有工作都会作废。
这类任务的另一个难点在于专家轨迹极其稀缺。一个有经验的医生如何在电子病历系统中完成一项复杂任务,这些操作记录很难大规模采集和共享——涉及患者隐私、合规要求、以及各机构系统差异。
现有的医疗Agent评测体系——MedAgentBench覆盖300个医生编写的电子病历任务,HealthAgentBench包含54项医疗任务,AutoMedBench对规划、配置、验证、推理、提交五个阶段分别打分——已经能定位Agent在哪个阶段失败。但这些诊断信号在标准训练流程中被丢弃了。
图注:BaT将结构化评测转化为递归训练循环,包含Stage Bank数据流水线和BiCuRL训练方法
把诊断信号变成训练信号
BaT的核心想法很直接:既然评测能告诉你Agent在哪个阶段弱,那就让这个信息指导下一步练什么。
系统由两部分组成。第一部分是Stage Bank——一个异步数据流水线。它不直接使用评测集中的真实任务(避免数据泄漏),而是合成虚构但结构相似的训练状态。每个状态被标记为三个训练池之一:S-target(针对当前最弱阶段的集中练习)、S-mix(其余阶段的混合练习)、E2E(完整工作流的端到端练习)。
第二部分是BiCuRL(双层课程强化学习)。外循环读取评测的阶段分数,选出下一步应该重点练习的阶段,并决定是否接受新的模型检查点。内循环从Stage Bank中采样训练状态,让Agent执行轨迹,用评测标准中的rubric项目打分,然后通过GRPO(Group Relative Policy Optimization)更新模型。
关键设计在于"内容隔离":只有聚合的阶段分数跨越评测和训练之间的边界,任务ID、答案、路径、报告等具体内容始终保持在held-out集合中。这意味着模型从未在评测的真实任务上训练过,它学到的是阶段能力而非任务记忆。
4B和9B翻倍式提升
实验结果相当惊人。在AutoMedBench-Lite上:
- BaT-4B的Overall得分相比Qwen Instruct基线翻了一倍多
- BaT-9B的Overall得分同样翻倍
- BaT-9B Agent达到79.6 Overall,超过Claude Opus 4.6配Claude Code的77.5
- 在外部测试集上,9B模型在三个推理任务上与基线的差距控制在3.4-5.8分之内,同时在SWE-bench Verified和Terminal Bench 2.0上有所提升
图注:BaT-9B Agent在AutoMedBench-Lite上超越Claude Opus 4.6 + Claude Code组合
值得注意的是,完整的Stage Bank混合(包含S-target、S-mix和E2E三个池)优于任何单独的部分。这说明阶段集中练习和全局练习是互补的,不能只做短板训练。
源势AI观点
BaT的意义超越医疗AI。它回答了一个行业级别的工程问题:当专家轨迹稀缺时,如何让Agent持续进化?
答案是结构化评测 + 合成训练数据 + 课程学习的组合。评测不再只是事后打分,而是训练循环的一部分。合成数据解决了隐私和规模问题,课程学习确保模型优先补齐短板。
这个思路可以迁移到任何多阶段工作流的Agent训练中——代码工程、数据分析、科研辅助。关键前提是:你的评测体系必须足够结构化,能够定位到阶段级别的失败。笼统的"总分"不够用,需要拆到具体环节。
小模型赢大模型的故事越来越多。这次的关键不是架构创新,而是训练方法的工程化。
---
*来源:*
1. *NVIDIA BaT论文 (arXiv:2608.16211, 2026-08-17)*
2. *AutoMedBench-Lite评测基准 (Liu et al., 2026)*
3. *Shao et al. GRPO (Group Relative Policy Optimization, 2024)*