Agent 圈子里有个没明说的困境:任务链越长,成功率越低,而失败的 Agent 有两种死法——要么在错误路线上一条道走到黑,要么毫无章法地反复换方向,把失败包装成探索。微软和上海交通大学的团队8月发布的 Argus,试图给这个问题一个工程答案:用验证来约束坚持与转向。

坚持和转向,都得有证据

Argus 的设定是一个持久化、可自进化的 Agent 运行时:Manager、Planner、Engineer、Reviewer 四个角色,在持久项目状态上执行有边界的任务(mission)。模型权重全程不动,所有进化发生在运行时的持久状态和控制策略里。

它的核心合同是:把稳定的用户意图,和可以被证据修正的操作目标、约束、验证标准分开。每次实质性改变——换路线、改目标、存经验——都必须有证据支撑、经角色审查、被记录下来。用论文的话说,不受约束的转向跟"合理化的失败"没有区别(来源:Argus 技术报告,arXiv:2608.05144,2026-08)。

验证把关的门禁(verification-gated admission)决定什么东西能被复用:候选的记忆、技能、流程、验证器、路由决策,还有被否决的路线,只有经过角色审查、拿到任务级验证证据之后,才进入可复用池。失败不会消失,被否决的路线也会被记录,防止下一个人再踩一遍。

Argus运行时架构与七个基准任务

图:Argus 运行时架构。Manager 统筹,记忆与技能经验证门禁后跨任务复用(图源:Argus 技术报告)

成绩单:78%与省21%

跑出来的数字值得细看。在自主执行任务的基准测试里,同一个 Argus 运行时在七个 GPT-5.5 基准竞技场保持有效:SWE-Bench Pro 上约78%,而 Direct Copilot 是59%;代价是总 Token 消耗1.41倍。AARRI-Bench 研究任务上76.8%,数学数据合成拉开28.0分的差距(来源:Argus 技术报告,同上)。

真正有意思的是纵向数据。在731个 SWE-Bench Pro 任务的完整轨迹里,成熟波次(mature waves)比起步波次每任务少用21%的求解输入 Token、少花15%的主动工作流时间——这是运行时自进化真实发生的证据。期间记录了34次验证器恢复、22次严格审查循环救援;466个任务调用独立 Reviewer,Reviewer 在43个任务上拒绝宣布完成,其中34个后来通过了官方验证器。

注意这组数字的含义:Reviewer 的"否决"不是流程负担,而是质量保险。43次否决里34次事后证明救对了。

验证工程,正在成为独立学科

Argus 不是孤例。腾讯研究院《2026人工智能十大趋势报告》把这件事命名为"驾驭工程"(Harness Engineering):模型越来越强,像一匹野马,核心问题从"怎么问"转移到"让它在什么规则下跑"。从2022-2024年的 Prompt Engineering,到2025年的 Context Engineering,再到2026年的驾驭工程,竞争前沿正在从模型内部移到模型外部(来源:腾讯研究院《2026人工智能十大趋势报告·协同进化》,趋势04)。

Argus 恰好是驾驭工程里"验证"这一环的完整样本:验证器不只用来验收结果,还用来决定什么经验值得留下、什么路线该被否决、什么时候该停下来。报告里还有个容易被忽略的设计:自治不是无限的,任务在明确的操作者升级点(operator-owned escalation points)之间自主运行——该叫人的人还是得叫。

Argus关键数字卡片

图:Argus 关键运行数据。验证器否决34次救对,成熟波次省21% Token(源势AI 制图)

源势AI怎么看

我们在企业里落地 Agent 项目,最大的教训之一就是:没有验证环节的自进化,等于让实习生自己给自己打绩效。

第一,经验复用必须有门禁。我们在能源和金融行业的 Agent 项目里,所有沉淀进技能库的经验都要过独立审查加任务级证据双关,原因跟 Argus 一样——被污染的经验比没有经验更贵,它会教坏后面所有任务。

第二,把"否决"当资产。很多企业把 Reviewer 的打回率当成流程损耗,Argus 的数据给出了反例:否决是发现问题的最便宜方式。我们建议客户把否决记录沉淀成负面案例库,这比成功案例更值钱。

第三,Token 账单要分阶段看。Argus 起步阶段比直接调用贵41%,但成熟后开始倒赚。评估 Agent 系统的成本,不能只看第一周的账单,要看学习曲线的斜率。

Agent 的下一轮竞争,比的不是谁的模型更强,而是谁的验证机器更硬。模型是发动机,验证是刹车,只有发动机的车不敢上路。