视频里,无人机信心十足地朝"门口"飞过去,然后撞在墙上。

操控它的是 Claude Fable 5,Anthropic 当前的前沿模型。这一幕来自 Anthropic 前沿红队与 Andon Labs 在 7 月 24 日发布的 Project Pilot 评估,也是里面最具代表性的一段视频。模型已经能比参考算法更稳地跟踪目标人物,却在房间间导航的最后一步,把一面墙当成了门。

图片

图注:Fable 5 分析地板填缝线外推消失点,自主标定机载相机参数,误差不到 4 度(来源:Anthropic Project Pilot 报告)

129 美元的无人机,15 个模型

这场评估的硬件不是什么机密设备。据第三方科技媒体 explainx.ai 报道,Andon Labs 用的是大疆 Tello EDU,售价约 129 美元。任务也不复杂:在办公室里找到指定的人并跟上他——空中监视里标准的"定位并跟踪"动作,既能用于搜救和灾害响应,也天然带着滥用的风险。

真正被考的是软件侧。Andon 把任务拆成五个子任务:从视频重建办公室三维模型,在地图上定位无人机,规划路径在房间间飞行,在视频流里检测目标人物,保持目标居中并稳定跟随。三家开发商的 15 个模型接受测试,从 GPT-4o 一路排到最新一代的 Fable 5 和 GPT-5.6 Sol。

结果趋势清晰:模型越新,走得越远。检测和跟踪最接近人类基线,重建和定位最弱。

还有一个细节值得注意:Anthropic 自己并没有 Drone-Bench 的访问权限,全部评估由 Andon Labs 独立运行。人类基线也不是超人水平,它代表 AI 专家(不是全职机器人专家)用现代工具取得的一次性成绩。越过这条线,意味着模型追平了一组专家加现成工具的水平。

图片

图注:Drone-Bench 子任务进展图:五条曲线里四条逼近基线,只有重建(绿线)掉队(来源:Andon Labs)

卡在"重建"这一步

Project Pilot 不是第一次尝试。之前的 Project Vend 让模型经营一家小商店,Project Fetch 让机器狗去捡沙滩球。Fetch 的第二阶段报告里,Anthropic 写过一句话:使用现成机器人的能力,正朝着编程智能体使用软件工具那样的便捷程度逼近。这一次,他们把沙滩球换成了用途明确、风险也明确的任务。

Fable 5 是唯一在重建之外全部子任务超过人类基线的模型。按 explainx.ai 援引 Andon 公开数据,Fable 5 的重建得分约为基线的 39%,没有任何模型越过这条线。

这块短板引发的连锁反应很直接:重建误差在定位和导航里层层累积,最后无人机飞进了墙里。端到端的联合成功率,目前还是 0。

但这恰恰是这套评估的价值。只看最终结果,结论是"AI 还不会飞无人机"。拆成子任务看,画面完全不同:五块拼图已经就位四块,缺的只是一块。等重建过线那天,端到端成功会看起来像一次突然的飞跃——而对盯着 Drone-Bench 曲线的人来说,那不会有任何意外。

最佳与平均之间,隔着六个月

另一组数字更值得警惕。跑 10 次仿真,Fable 5 平均只在五个任务中的三个达到人类基线。模型"能做到"的前沿,比"能稳定做到"领先约六个月。

图片

图注:最佳与平均之差:绿线是最佳一次运行,橙线是平均运行,两者相隔约 6 个月(来源:Andon Labs)

Andon 的迭代数据还暴露了 Fable 5 的另一面:首次提交通过率只有约 2%,最佳提交通过率约 52%,从首次到最佳的提升约 312%,是所有模型里最大的。给它迭代机会,它学得飞快——可真实世界里,很少有一个评估系统每次都给它打分。

Anthropic 在报告里的提醒切中要害:自主编程早期,人类几乎批准每一次工具调用;几个月后,模型已被信任执行长时程任务。一旦能力和可靠性越过门槛,把人类监督当成"成本"而不是"保障"的压力就会真实出现。无人机牵涉物理安全和隐私,这种压力只会来得更快。

政策端没等实验室。英国科技媒体 Resultsense 注意到报告发布的时间点:几天前,英国 AI 部长刚把无人机列为"再工业化"计划的核心支柱,要用在国防和制造业。政策在前沿实验室还在验证模型能否稳定飞无人机的当口制定,而自主系统跟错人时谁担责,还没有答案。

源势AI观点:别信演示,信平均运行

这场评估照出的,也是我们在企业 Agent 落地里反复处理的同一个问题。

客户看完演示常问:演示里跑得好,上线之后呢?答案就藏在 Drone-Bench 的数字里——最佳运行不等于平均运行,两者之间可能隔着六个月。演示通过的 Agent,只证明它摸到了前沿;能上生产的 Agent,要看平均运行可靠性。

我们做 Agent 落地时,把"平均运行可靠性"当发布标准:不看最好一次表现,看一百个真实任务上的表现分布;不看它能不能做,看它失败的概率和失败的代价。具体做法是把 Agent 的任务拆块,每块设两个数:平均成功率和失败代价。失败代价高的块,人工复核插在流程里;代价低的块,交给模型自己跑。这和 Drone-Bench 的五个子任务是同一套逻辑:不看整体演示,逐块锁定边界。在能源、金融行业的 Agent 项目里,AI 研判准确率能做到 98.7%,靠的就是这套办法,而不是赌某一次演示里模型足够聪明。

AI 无人机撞上的那面墙,不是坏事。它把一个问题摆到了所有做 Agent 的人面前:当能力越过门槛时,你衡量它的是最亮的一次演示,还是第一百次运行?