所有人都在让 Agent 跑得更久。一份 8 月 5 日发布的新技术报告问了相反的问题:它怎么知道什么时候该回头?
这份报告叫 Argus(arXiv:2608.05144),来自微软与上海交通大学、复旦、清华等机构。它提出一个面向长程任务的 Agent 运行时,核心判断很直接:长任务的胜负手不是耐力,是"何时坚持、何时改道"的决策质量。
过去一年,Agent 的上下文从几万 token 扩到上百万,任务时长从几分钟拉到几天。但跑得更久不等于跑得更好。SWE 类基准上,多数系统的失败模式高度一致:早期选错路线,然后一路执行到底。Argus 想解决的就是这个。
硬撑,是长任务最常见的死法
长任务最常见的失败不是停下来,是硬撑。路线已经走不通,Agent 还按原计划执行到底,最后交出一份格式漂亮、内容没用的结果。
Argus 把两种"改变"区分开。一种是失败后放弃,一种是发现路线错了之后改道。两者外表一样,性质完全不同:前者是失败,后者是进步。但没有证据的话,谁都分不清。
所以 Argus 给"改变"装了一道闸门:每次实质性改道,必须有证据支持、由指定角色审查、留下记录。三个条件缺一个,改道就不算数。报告里有个细节很说明问题:一条被证伪的数学证明路线,没有被删掉,而是作为"此路不通"的记录保留在状态里,供后续任务检索。
四个角色,各管一段
Argus 把 Agent 拆成四个角色:Manager 管方向,Planner 拆任务,Engineer 干活,Reviewer 查结果。模型权重一个字节不改,进化全部发生在运行时状态里:记忆、技能、工具、验证器、路由策略。
这个结构像一个真实的研究组:干活的人不能自己拍板换方向,查结果的人不亲自下场。在 731 个 SWE-Bench Pro 软件修复任务里,466 个任务被路由给独立 Reviewer,其余 265 个用 Engineer 自查。被路由的任务平均多花 2.75 倍 Token 和 1.8 倍时间,换来 388 个一次通过、43 个修改后重审、34 个最终通过官方验证器。
效果有总分背书:Argus 准确率约 78%,同底座的 Direct Copilot 约 59%,相差 19 个百分点,代价是 1.41 倍总 Token。
图注:Argus 运行模型:四角色循环跑在持久状态上,橙色虚线是回退,红色虚线是被否决的分支。来源:Argus 技术报告 Figure 2
越用越省,但曲线不单调
更值得看的是纵向数据。随着运行时状态积累,成熟期(W19–22)每个任务比启动期(W1–6)少用 21% 的输入 Token,活跃时间少 15%。
这条曲线不是单调下降。报告如实记录了 34 次验证器恢复和 22 次严格审查救援:系统走错了,审查把它拉回来,再把这段经历写进状态。错误没有浪费,变成了后面的路标。
其他竞技场的成绩:研究类任务 AARRI-Bench 得分 76.8%(63/82),对照论文最佳 68.3%;数学数据合成领先第二名 28.0 分;nanochat 训练在 B200 上跑出 0.9636 BPB,略好于人类最佳的 0.9646。它优化出的 RWKV6 内核,被合并进了上游 Flash Linear Attention 仓库。
图注:731 个任务的运行结果:准确率 78% 对 59%,成熟期单任务 Token 降 21%。来源:Argus 技术报告 Figure 4
多日战役:254 个任务,16 次回退
单任务的成绩之外,报告还记录了六条跨越多天的论文生产流水线:合计 254 个 mission、16 次 Stage 回退,最终全部走到投稿完成。其中一条轨迹跑了 163.6 小时。
16 次回退不是事故统计,是系统在主动放弃走不通的分支。材料学那条线更有意思:Argus 最终采纳的方法,比它要替代的已发表方法更简单,而且通过了运行时并不拥有的外部检查器 MOFChecker 的验证(989 对配对晶体,前向计算预算对齐)。
换句话说,它没有用"更复杂"来证明"更先进"。验证标准在外部,成绩才算数。
源势AI观点:企业 Agent 同样需要"审查制度"
我们在企业智能体落地中碰到的是同一类问题。客户不缺 Demo,缺的是跑长任务不散架的 Agent。Argus 的实践里有三条可以直接搬进企业项目。
意图和目标要分开。用户的意图稳定,操作目标允许带证据地修正。不分开,Agent 要么跑偏,要么硬撑到底。我们做能源和金融行业的 Agent 时,把"什么情况下可以改目标、谁批准、留什么记录"写进流程,而不是写进提示词。
验证是闸门,不是装饰。经验只有通过验证器和审查才能进入积累,否则积累下来的不是经验,是错误。Argus 的 22 次严格审查救援说明:审查的成本(2.75 倍 Token)远低于错误经验污染状态的成本。
执行者不审查自己,审查者不亲自执行。角色分离写进系统结构,比写进提示词可靠得多。
Agent 越聪明,越需要学会回头。Argus 给出的答案是:回头可以,但要带证据、过审查、留记录。报告结尾还提到,这些轨迹,对的和错的,都会成为未来监督学习和强化学习的结构化数据。走错的路记下来,也是资产。
图注:七个基准竞技场的结果,全部使用任务原生指标。来源:Argus 技术报告 Table 4