一图读懂

去年8月,Anthropic 做了一场实验:让一群不懂机器人的员工,用一台市售机器狗完成连传感器、写控制程序、自主取回沙滩球这一串任务。队伍分两组,一组有 Claude 帮忙,一组全靠搜索引擎和自己琢磨。结果有 AI 的那组赢得没悬念。

不到一年,同样的实验重跑了一遍。这一次,人类没有参赛资格了。

人类只剩接线员的份

第二阶段的规则很简单:Claude Opus 4.7 在 Claude Code 里独立干活,人类研究员的工作被压缩到四件事——把笔记本接上机器狗、输入初始提示词、批准命令执行、批准进入下一个任务。

结果写在 Anthropic 6月18日发布的《Project Fetch:第二阶段》里:在至少有一支人类队伍完成的每一项任务上,Opus 4.7 的完成速度至少快10倍;只看两支队伍都完成的四项任务,Opus 4.7 平均比无 Claude 队快37倍以上,比有 Claude 队快18倍以上。全部任务放在一起,它比最快的人类队伍快约20倍(来源:Anthropic《Project Fetch:第二阶段》,2026-06-18)。

还有一个数字容易被忽略:Opus 4.7 完成同样的任务,产出的代码量比有 Claude 的人类队少了近十倍。人类队伍在好几种传感器对接方案之间来回纠结、反复试错,模型直接识别出最优路径,写出的代码大部分第一次跑就能用。

Project Fetch第二阶段各任务完成时间对比

图:Project Fetch 第二阶段任务完成时间对照,Opus 4.7 对两支队伍形成数量级差距(图源:Anthropic 报告)

当然它不是没犯错。比如默认挑了一个过时的物体检测算法,但它自己发现了问题、绕了过去,最后还是给出了能用的方案。这种在岔路上自己纠错的表现,一年前的模型做不到。

球还是推不好

快不等于全能。实验里有个任务,人类队员练一会儿就能完成:用手柄操控机器狗,把沙滩球轻轻推回基地。这事需要闭环——随时感知球偏没偏、偏差跟上一条指令是什么关系、下一步怎么修正。这是人类擅长的技能。

Opus 4.7 做不到。它能移动到球后面、调整位置、把球撞回去,但控制得很糙,没有一次成功。跟它一起"失败"的,还有那些闯入自主取球阶段的人类队员——这个任务对谁都难。

Embody基准:模型得分取决于本体和控制接口

图:Embody 基准套件综合得分,同一模型在不同控制接口下表现差异巨大(图源:Anthropic《Claude plays robotics》)

更底层的问题,Anthropic 在7月的《Claude plays robotics》里测得更细:让模型直接驱动关节,它们大多失败;让模型监督一个预训练控制器、或者用高层指令调策略,它能完成真实的导航和操作任务。同一个模型,显得弱还是强,取决于给它的是力矩接口、代码接口,还是策略接口。在仿人机器人这类难控的本体上,当前模型只在高抽象层级的接口上有进展(来源:Anthropic《Claude plays robotics》,2026-07-09)。

一句话总结:模型现在擅长的是"当工程师",不是"当小脑"。

进步来自规模化,不是专项训练

这份报告里最值得划重点的一句话是:这一进步并非刻意提升模型机器人能力的结果。与 LLM 发展史上的许多进步一样,它来自更普遍的规模化。

没有人给模型单独开机器人课程,能力是溢出来的。这就很值得警惕了——能力边界的推进不按人们的预期节奏走。

Anthropic 还点出了一个在多个领域反复出现的模式:先是模型对人类有帮助,然后是人类对模型有帮助,最后模型在很大程度上自己做事。这个路径在网络安全领域已经走过一遍,如今在 AI 与物理世界的交汇处开始成形。

Opus 4.7 与人类队伍代码量对比

图:关键数据一览。代码量少近十倍、速度快20倍,意味着模型在集成类任务上已形成效率碾压(源势AI 制图)

源势AI怎么看

我们把这个实验当作一条节奏曲线来看:AI 接管物理世界的第一步,不是控制本体,而是接管"让本体干活的前置工程"——连传感器、写接口、跑通集成、编排任务。这一步的 ROI 已经非常清楚。

对企业落地,我们的判断有三层。第一,短期内不要指望模型直接接管产线和现场设备的底层控制,精细闭环操作它还做不好。第二,"让模型写控制代码、接设备、跑通集成任务"这个层级的窗口已经打开,能源巡检、工业设备接入这类场景里,让 Agent 先把软件集成的活干完,把人的时间省到决策和异常处理上,现在就能算清账。第三,评估你的自动化项目时,把"模型迭代速度"当成一个独立变量——这次实验里,一年时间,差距从"帮得上忙"变成了"快20倍",项目周期超过一年的,都要把这个变量算进去。

机器狗都能自己跑通仓库任务了。排除硬件领域出现同样轨迹的想法,是不明智的——这是 Anthropic 的原话,我们同意。