导读:假如把一支足球队交给 AI 经营,连管二十年,会发生什么?一支来自 AnalogyAI 的团队真做了这场实验:15 个当前最前沿的大语言模型,各带一支球队,跑满 20 个赛季、约 340 到 400 次决策,26 个工具随便用,最后由一个确定性引擎自动计分,没有人类裁判、也没有大模型评委。结果和直觉拧着来:最贵的模型不一定赢,开源模型能挤进前三;算力花销和名次完全对不上,烧钱最多的反而垫底;前五年领先不算数,跑满二十年排名彻底洗牌;真正决定成败的,是模型怎么记笔记。这篇文章顺着这几条反直觉的结论,拆开这套考试的设计、六个行为维度的发现、人类选手的对照,最后落回一个问题:长周期的 AI 智能体,到底该怎么评估、怎么设计。

第 1 章 结论前置:把俱乐部交给 AI 二十年,会发生什么

足球场与芯片融合,机器人经理叉腰站在场中央,头顶三座奖杯

我猜你每天都会让 AI 干点活:写邮件、写代码、回客服。这些是执行,错了当场就能看见,改也快。可还有一类事叫管理:经营一家公司、带一支球队、做一笔几年后才见分晓的投资。管理难的从来不是做对当下这个决定,而是几百个决定连起来之后,还能不能不出大错。那如果真把一支足球队交给一个 AI,二十年不管,它给你带回什么?

这事离你并不远。现在已经有公司让 AI 当客服主管、当运营助理、当投资顾问,这些活都要连续做几百个决定,后果延迟显现。我们缺的不是会干活的 AI,缺的是判断它能不能长期把一件事管好的办法。而真要判断,就得有一场足够长、足够真实、足够公平的考试。这场足球实验,就是为这个问题设的一道考题。

AnalogyAI 团队最近真做了这场实验。他们挑 15 个当前最前沿的大语言模型(large language model,LLM),让每个模型独立经营一支足球队,一连 20 个赛季。每个模型要做出约 340 到 400 次决策,手里有 26 个工具,能查数据、谈合同、买球员、排阵容,还要和一群脚本驱动的对手俱乐部同场抢冠军。比赛跑在一个足球经营游戏里:每季 30 轮,二十个赛季累积约 4800 场模拟,约 470 名在役球员进进出出。论文和代码都挂在 arXiv 和 GitHub 上,谁都能下载来跑一遍。最后的分谁说了算?一个确定性引擎(deterministic engine)自动累积分,没有人类裁判,也没有另找一个大模型来当评委。结论一句话就能说完:最能打的,不是最贵的。

把结论摊开,一共四条:最贵的模型不一定赢,开源也能排进前三;算力和价格跟名次没有关系,花得最多的反而垫底;前五年领先不算数,跑满二十年名次可能彻底翻转;真正决定成败的是记忆策略,怎么记笔记比怎么花钱更关键。

把这四条放一起看,会发现它们指向同一件事:我们平时用来判断一个 AI 强不强的标尺,价格、体量、早期表现,在这里集体失灵了。它们不是没用,只是不够。真正拉开差距的,是那些看不见、也贵不起来的习惯:会不会提前安排、敢不敢把钱花出去、笔记到底怎么写。这些习惯,恰恰是后面几章要逐条拆开的东西。

先说最扎眼的这条。排第三的 kimi-k2.6 是个开源模型,得分 88.49,压过了两个体量更大、定价更高的闭源 GPT 变体,gpt-5.6-terra 的 86.66 和 gpt-5.6-sol 的 86.40。冠军 claude-fable-5 拿了 90.94 分,垫底的大模型 haiku-4.5 只有 36.90 分,比照纪律行事的脚本也高不了多少。15 个模型里 10 个闭源、5 个开源,最后站在领奖台附近的,既有顶级闭源,也有免费就能下载的开源。钱和厂商名气,在这里没有自动兑换成更好的名次。为了让你有分数的概念,论文还放了几个不用动脑的脚本当尺子:一个照纪律行事的脚本得 17.05 分,什么都不做的得 -0.90 分,完全随机的策略得 -17.21 分。乱动不但不加分,还会把俱乐部越做越贬值。

更让我意外的是算力花销这条。所谓词元(token),是模型处理文本的基本单位,用多少词元,大致就是烧了多少算力和钱。论文把各种口径的词元消耗和美元成本跟最终排名做了相关,系数落在 -0.19 到 +0.07 之间,p 值全大于 0.38。p 值大于 0.38 的意思是,这些相关系数在统计学上跟零没有差别,纯粹是噪声。翻译成大白话,算力花销和成绩之间找不到任何关系。烧掉 194M 词元的 deepseek-v4-pro 只排第十,烧掉 191M 的 grok-4.5 排第八,冠军 claude-fable-5 只用了 24M 词元,是全场最省的三家之一。二十年跑下来,词元消耗的跨度有 7 倍,名次却跟这笔账完全对不上。按每百万词元的效率算,最省钱的三家恰好是冠军这一档,最重度的花费者反而垫底。算力在这里更像一张入场券,买到了才能上桌,买得再多也不保证赢。

还有一条更隐蔽:前五年领先的模型,二十年下来可能垫底。deepseek-v4-pro 在第 5 年和第 10 年都是全场领先,最后掉到第 12 名;冠军 fable-5 在第 5 年只排第 5。用数字说,第 5 年的排名和最终排名相关系数只有 0.19,接近瞎猜,要熬到第 15 年才爬到 0.78。只跑五年就下结论,你会选出一份完全不同的榜单。这背后的原因值得多说一句:有些动作看起来永远安全,比如把现金攥在手里不花,当下挑不出任何错,代价却要几个赛季后才显形。短期看谁都挺聪明,拉长了,谁在裸泳才看得见。这也顺带解释了为什么这考试非得拉满二十年。

我自己最在意的是最后这条,它藏在记忆里。这套考试有个苛刻设定:每个决策停点(decision stop)都是一段全新对话,模型看不见之前的聊天记录,唯一能跨停点留下来的,是它自己写的一本笔记本(notebook)。为什么要这么苛刻?因为二十年积累下来的历史,早就超过了任何模型的上下文窗口,模型想记也记不下,遗忘躲不掉,区别只在于它选择忘掉什么、留下什么。写什么、怎么改,全由模型自己决定。光记笔记的方式,就暴露了两种死法:有的只往里追加,二十年攒成一本越来越厚的流水账,当前状态被旧历史淹没;有的每季推倒重写,计划永远来不及落地。冠军的写法是中间态,骨架稳定、状态每季更新。记忆策略成了决定成败的分水岭,这一块后面专门讲。

往下讲之前,我先把丑话说在前面:这套考试之所以可信,是因为它把作弊和偏心两个坑都堵死了。整个模拟跑在确定性引擎上,同一个随机种子、同一串动作,跑多少遍都是同一个结果,可以逐位重放,任何人都能复现。设想两个模型做了完全一样的动作,它们就该得到完全一样的结果,谁也别想靠运气蒙混过关。20 个模拟年,单核 CPU 只要 76 秒,配套 284 项测试,结果文件还带着引擎版本和参数的哈希,能对账、能审计。每个模型在 3 个不同种子下各跑一遍,看波动。市面上很多评测会让一个大模型去给另一个大模型的回答打分,这种裁判本身就有偏好、会出错;这里没有裁判,分数完全由机制累计。

再补一个能建立直觉的数字:约 340 到 400 次决策,相当于每天做一次重要决定,连续做 20 年。这么长的周期里,早期一个错误会像复利一样滚很多年才显形。这套考试想测的,不是模型能不能答对一道题,而是它能不能把一家要活二十年的俱乐部管好。论文还把模型表现拆成六个可测量的行为维度,终局意识、资金部署、主动控制、价格发现、记忆策展、算力效率。其中终局意识与最终成绩的关系最紧,相关系数 -0.58,资金部署与主动控制也咬得很紧,分别是 -0.50 和 +0.45。冠军的可怕之处在于六个维度没有一个明显短板,中游模型往往一强一弱。

再给个参照系。论文配了个开挂脚本,叫它特权 oracle(privileged oracle),它能直接读引擎的隐藏状态,动作还是走同一套 26 个工具,拿了 95.54 分,算理论上的能力上界。冠军 fable-5 的 90.94 分已经摸到 oracle 的约 95%,整套考试的理论天花板约 145 分,远没到顶。这说明分数不是随便堆出来的,也说明还有上升空间。

这篇文章会顺着这条反直觉的线索往下走。第二、三章先交代这场考试是怎么设计的,为什么非要用足球当考场,用什么办法保证公平;第四到第八章逐个拆开排名背后的原因,钱、算力、定价、记忆、人类对照;最后一章回到我们身上,聊聊长周期智能体该怎么评估、怎么设计记忆。而这一切,得先从一个看似简单的问题说起:为什么要费这么大劲,专门造一场足球经理的考试?

第 2 章 为什么要造一个"足球经理"考试

四块蓝色积木塔:眼睛、沙漏、箭头、天平,象征管理的四种压力

你可能没听过"基准"(benchmark)这个词,但它的逻辑你一定熟:想比较两个 AI 谁强,就给它们同一套题,看谁得分高。现在市面上最流行的那几套题,出的几乎都是"执行"题。SWE-bench 是让 AI 去修一个软件漏洞,WebArena 是让它在网页里点来点去完成任务,τ-bench 是让它扮客服把顾客的问题解决。这些题有个共同点:任务短、答案当场可判、做完就收工。你交上去一段代码,跑通了就是满分,跑不通就是零分,黑白分明。这类题刷出来的高分,久而久之成了 AI 的简历,谁都能在上面写两笔。可说到底,它们测的是"会不会炒一盘菜",不是"会不会经营一家餐馆"。

下棋和经营餐馆的区别,正好卡在一个词上:长周期决策(long-horizon decision-making)。下棋每步的后果当场就显出来,吃掉一个子就是吃掉一个子,棋盘不会因为你昨天用过某招就偷偷涨价。经营餐馆不一样:你今天换了菜单,要三个月后才在账本上看到反应;你上周辞退了那个后厨,半年后才知道是不是个错误。现实里大多数工作更像餐馆,不像棋盘。运营一个产品、带一支团队、管理一笔预算,做的都是后果延迟显现、还互相纠缠的决定。管理的本质,就是在这种延迟里还能持续做对。而这件事,恰恰是我们在工作里最常被要求、又最容易被忽视的能力。

如果这些基准只是用来测"执行",问题不大。问题在于,我们渐渐拿这些短题的成绩,去替 AI 打包票,说它"能干活""能管业务"。论文就戳破了这一点,说现有基准缺了三样东西。

缺的第一样,是长任务不竞争。就算让 AI 去管理一个仓库、跑一条供应链,它面对的通常是个静止的世界:货价不变、对手不动、规则不翻脸。可真实的生意场上,你的每一个动作都会被对手看到,对方会看穿你的打法,反过来压价、抢人、堵你的路。你降价促销,对手隔天就比你更狠;你囤了一批货,对手就故意等你资金链紧张再出手。没有对手的考试,测不出你会不会打架,更测不出你打不打得赢。

缺的第二样,是竞争不持久。有些评测也安排了对抗,但只跑一两轮就收工。一两轮测不出"反适应",因为对手还没来得及学会应对你,考试就结束了。真正的较量是反复的:你涨价,对手跟着涨,你再换招,对手再拆招,二十回合之后谁还站着才算数。要等一个对手真正吃透你的套路,往往不是几天,是几个赛季。

缺的第三样,是短任务只测执行。会修一个 bug,不代表会运营一个产品三年。执行是对当下的一个指令做出正确反应,管理是把几百个当下连成一条线,还得保证这条线二十年不断。执行题里,做对一步就是一步;管理里,今天做对的一步,可能是三年后那场崩盘的伏笔。这是两种完全不同的能力,后者在短题里根本无处安放,只能靠一场长到让人不耐烦的考试来称。

那为什么大家以前一直用短题?一个现实原因是,长任务慢、贵、还难评分。一道修 bug 的题,几秒钟判对错;一场二十年的经营,得分怎么算都扯不清,稍不留神就成了评委说谁好就是谁好。所以短题先跑了起来,也够用。问题出在我们忘了它的边界,把"会修 bug"当成了"会经营公司",这才需要一场专门的长考试来补。

真实世界的管理,恰恰把这三样全占了:又长、又有对手、对手还越来越了解你。为了把这股压力逼出来,论文给这场足球考试埋了四道坎,他们管这叫四个"需求"(demand)。

第一道坎是隐藏信息(hidden information)。球员的真实能力、成长潜力,还有伤病倾向、成长速度、状态老化的起点这些隐形特质,对所有人都藏着,包括你自己。你只能派球探去看,球探交回来的是一串带个人偏见的区间估计,而不是准确数字,而且这个偏差是永久的,你永远只能估到一个"真相加偏差"的位置。想要更准?那得靠跨赛季的统计推断慢慢逼近,急不来。赛季比分、合同、财务这些倒是精确可见的,可光看比分,你分不清赢球是靠球员还是靠运气。这就像二手车市场:卖家清楚车况,买家只能靠试驾和检测去猜。做管理的第一课,就是学会对着噪声估一个靠谱的数。

第二道坎是累积后果(cumulative consequences)。投青训、建训练设施,这些钱砸下去要好几年才见效;可一旦现金流断裂,俱乐部会破产,破产要扣分、要强制卖人,董事会信心崩了还会直接炒你鱿鱼。被炒之后也不是全盘归零,游戏给了一次重启的机会,但要打不小的折扣,这些后面会细说。前期犯的错不会当场爆炸,它会像复利一样滚很多年才找上门。而荣誉是逐年攒进最终得分的,每一个赛季的选择都在给二十年后的账本添一笔。这跟健身一个道理:今天练不练,三个月后才显在镜子里。

第三道坎是反适应市场(counter-adaptive market)。你报的价被拒一次,卖家心里就把底价悄悄抬高了;你跟同一家俱乐部反复交易,对方也会坐地起价;谈判刷屏刷得太勤,还会触发冷却。没有哪套固定策略能一直最优,你越用某套赢球手段,它的效果就越差。就像菜市场里那个摊主,发现你总来买他的菜,下次就悄悄涨你价。市场是会记住你、会算计你的,这是下棋的棋盘上从来没有的东西。

第四道坎是多目标压力(multi-objective pressure)。董事会同时盯着两本账:成绩和财务。既要你出成绩,又不许你乱花钱,赛季目标还会随你阵容的强弱自动调整。满足了一个约束,常常就得得罪另一个:你想冲冠军,就得加大投入,可财务纪律的红线就悬在头顶;你想守住现金流,成绩单又会越来越难看。这跟既要考高分、又不能不睡觉,是同一个处境。

这四道坎,单拎出任何一道都不算难。信息不全?多派几个球探就补回来了。后果迟到?盯紧账本就是了。市场算计你?少跟人讨价还价就行。老板两头都要?先顾一头再顾另一头。难的是它们同时压过来:你想多派球探,钱就少了;你想囤现金防风险,董事会又催你出成绩;你想趁市场没涨价赶紧买人,可你连球员到底值多少钱都看不清。四道坎互相咬合,才是真实管理让人头疼的地方。

为什么偏偏挑足球?因为足球经理这个角色,几乎天然打包了上面四道坎:一个赛季有几十轮,买卖球员有转会窗,青训投入要几年才兑现,董事会一边看积分榜一边看资产负债表。你既是教练、又是采购、还是财务总监,几种身份拧在一个人身上。这些规则全世界的球迷都熟,不用额外解释。换成一个抽象的供应链模型,读者还得先学一堆术语;换成足球,大家一眼就懂这个经理在干嘛、这步棋大概意味着什么。足球还有一层好处:它足够长,二十个赛季足够让一个人从青年队踢到退役,也足够让一个错误的引援彻底暴露。

所以用一场二十年的足球经营当考场,不是图它好玩。是因为只有这么长、这么挤、这么较真的局,才能把短题里根本测不出来的东西逼出来。而在这套考试里,连"管理"这个词都被拆成了可以量化的动作。这本身就是件新鲜事:过去"管理"只能靠感觉去评,现在有人试着给它配了把尺子。下一章,我们就进到考场里,看看那 26 个工具、三四百个决策停点,到底是怎么排布、怎么保证公平的。

第 3 章 考场长什么样:确定性引擎、26 个工具、340 个决策停点

机器人站在空白日历前,用发光笔写悬浮笔记本,手腕锁链连向档案柜

上一章说的是为什么要考,这一章进考场,说说这考场到底怎么搭。先问一个最实际的问题:一场要跑二十年的考试,怎么保证它公平、可信,而不是谁运气好谁赢?考试要让人信,第一条就是:同一份卷子、同一个考生,不能这次高分、下次垫底。论文给的答案是三个关键词:确定性引擎(deterministic engine)、没有裁判、可逐位重放。

先说确定性引擎。你玩过带"随机"的游戏吗?开箱子、抽卡,结果每次都变,因为背后有个随机数发生器,而它常拿墙钟时间这类会变的东西当原料。这套考试也有随机,但用的是"计数式"的随机数发生器,一切随机都由种子(seed)锁死。同一个种子、同一串动作,跑一万遍也是同一个结果,连哪场比赛谁进球都一模一样,一个字节都不差。设想两个模型做了一模一样的事,它们就必须拿到一模一样的分数,谁也别想靠运气蒙混过关。

这个性质带来的好处叫逐位重放(bit-replayable)。整场考试二十年,从头到尾每一步都能原样重演,任何人都能复现论文里的每一个数字。要是你怀疑某个模型作弊了,可以把它的每一步都翻出来重放一遍。为了把这一点落到实处,作者写了 284 项测试盯着引擎,结果文件还带着引擎版本、参数、计分版本的哈希,能对账、能审计。一句话,这篇论文里每一个数字,你都能追到它到底是怎么算出来的。

考场的规模也摆一摆。一个世界里约有 470 名在役球员,二十年下来进出约 2000 名;每季 30 轮、每轮 8 场,二十年累积 4800 场模拟。每家俱乐部开局拿到的牌是一样的:声誉 70、一座 38000 座的球场、100M 的选秀预算、25 人的阵容。这么一场二十年的大戏,在单核 CPU 上只要 76 秒就能跑完,所以作者才敢让 15 个模型各跑 3 遍,还另设一个 15 家同场竞争的擂台。

这 15 个模型其实被分到两条赛道去考。第一条叫单机赛道(solo track),每个模型单独面对一批由脚本驱动的对手俱乐部,这些脚本有强有弱,当固定标尺用,看的是模型的绝对能力。第二条叫竞技场(Arena),把 15 个模型塞进同一个世界,大家互为对手,谁涨价谁压价都互相看得见,看的是相对的适应能力。两条赛道各考各的:单机赛道里能建立王朝的模型,进了竞技场,可能被对手的竞价一步步掏空。这个差别,第四章会细说。

真正要讲清楚的是决策停点(decision stop)怎么转起来。二十年不是一条连续的时间线,而是被切成一格一格的回合。每个赛季有 13 个计划停点,比如转会窗开了、赛季结算了,这些是定死的;还有约 6 个事件停点,比如主力受伤、对手来挖人,这些是临时蹦出来的。加起来一季约 19 个停点,二十年下来的中位数是 374 个,范围在 341 到 390 之间。换算成人话,就是每天做一次重要决定,连做二十年。为什么非要切成一格一格,而不是让模型一条线跑到底?因为切开之后,"思考"和"世界推进"就被拆开了:模型在一个停点里可以慢慢想,但世界要等它喊推进才会动。这一拆,也把记忆的需求逼了出来。

每个停点里,模型想思考多久都行,可以一轮接一轮地调用工具,直到它自己决定"我办完了",喊一声推进(advance),世界才继续往前走。工具箱里一共 26 件:12 件用来查信息,11 件用来做动作,2 件用来写笔记本,最后 1 件就是推进。查询的有翻球员档案、看报价、查历史交易;做动作的有开续约谈判、出价买人、挂牌卖人、调整阵容。工具也不是随便用的:每个停点里查询有 30 次的预算,谈判类动作只有 10 次,唯独写笔记本是免费的。查询要卡预算,是逼模型别当复读机把整份历史全翻出来;谈判只给 10 次,是逼它想清楚再开口,别刷屏。这个免费不是大方,是故意的,看到后面你就明白为什么。

到这里,我自己最喜欢的设计登场了:记忆。每个决策停点,对模型来说都是一段全新的对话,没有聊天历史。它不记得上一个停点自己说过什么、做过什么。唯一的例外,是一本它自己写的笔记本(notebook)。跨过二十年的唯一线索,就是模型自己决定写下来的那点东西。记忆本身,成了一道考题。

为什么敢这么狠?因为二十年积累下来的历史,早就超过了任何模型的上下文窗口,模型想全记住也塞不下。既然遗忘躲不掉,不如让遗忘变成显式的、有边界的、由模型自己负责的。这套考试给模型配了四层记忆。第一层是状态包自动上下文(packet auto-context),引擎每个停点免费塞进来:联赛排名、现金、董事会信心、伤病、报价、停点之间发生了什么,这些不用模型操心。第二层是档案(archive),一份可以查询的全量历史,想查什么自己调。第三层是审计日志(audit log),记录模型的每一个动作,但它只用来重放和防作弊,永远不给模型看。第四层才是笔记本,唯一承载模型意图的地方:计划、为什么买这个人、冬天该卖谁,都用 append_note 和 rewrite_notes 写进去,再自动注入到每一个新停点。

这么一摆,门道就出来了。前两层是引擎和系统给的,所有模型一视同仁;第三层干脆不给看;真正能拉开差距的,只有第四层里模型自己选择写什么、怎么改。所有模型面对的是同一份契约,差别只在于它们怎么对待这本笔记本。这也是后面第七章要重点展开的事。

最后说说分数怎么算。最终分由三块组成,每一块都做了对数压缩。对数压缩的意思是,从 0 分爬到 20 分很容易,从 60 分爬到 80 分要难得多,所以分数不会无限堆,也逼模型持续努力,而不是指望一锤子买卖。三块的配比有讲究:荣誉是过去的成绩,增值是现在的身价,阵容价值是未来的家底,三样加起来,才是一个俱乐部二十年之后真正的模样。第一块荣誉,拿一次冠军记 100 分,进前四记 20 分。第二块是增值(value added,VA),这是主通道,算的是你把俱乐部交回来的时候,比接手那天值钱了还是贬值了。第三块是阵容价值,一个"稳定器",防止有人只顾着刷荣誉、把家底掏空。

这里有个细节我特别喜欢:增值算的是净值,而净值不是账面上躺着的那堆钱。净值等于现金,加上阵容价值打八折的流动性折扣,加上设施,再减去还没付完的转会费欠款。所以"把俱乐部交回来,跟接手那天一样值钱",增值就是 0,既没败家,也没增值。而且现金里超过三倍年薪账单的部分,只按三折计价。这是作者埋下的"反囤积折扣"(anti-hoarding discount),专门治"把钱攥在手里装安全"的选手:钱堆着不算全值,逼你必须把钱变成能赢球的东西。这跟现实里很像:把钱存银行永远不犯错,但一家公司如果只会存钱,离死也不远了。

这套打分还有几个漂亮的性子。因为做了压缩,第一个冠军大约值 17.7 分,第二个 8.7 分,第三个 5.9 分,往后一路递减,所以想靠刷冠军封神是行不通的,理论上限大约 145 分。反过来,按市场公允价买人其实不加分,因为阵容价值要打八折,只有买进低于八折价值的"真便宜货"才真正增值。一句话,分数奖励的是持续把俱乐部做得更值钱,而不是赢一场、囤一笔这种单点操作。

还有一条规则管着"半途而废"。能跑满二十年的,系数是 1;中途被解雇、破产或者主动放弃的,分数要打折,越早放弃折得越狠。这个打折还埋了个小机关:只折正分,不折负分,所以不存在"我主动死掉止损"的套利空子;反过来,坚持到最后一段,比提前一点点结算要多拿 25% 的溢价。意思很明白:坚持到底这件事本身,是被奖励的。

考场就这么搭好了:公平由引擎保证,记忆由笔记本承载,输赢由机制累计。20 年、340 多个停点,就这么一格一格走完。15 个模型排好队进场,二十年后谁能打出来,下一章揭晓。

第 4 章 排名出来了:最贵的不赢,最能说的不赢

单人赛 19 席位最终得分条形图:oracle 95.5 上界、冠军 fable-5 90.9、开源 kimi-k2.6 88.5 超过两个 GPT 变体、heuristic 17.1 / idle -0.9 / random -17.2
赛季轨迹:冠军第 5 年 33.3 分后来居上至 94.6;deepseek 前 10 年领先(35.8 / 52.9)最终 79.0 排第 12

15 个前沿大模型,每个接手一支足球队,从同一批球员池里建队,然后独自经营整整 20 个游戏年。每过完一个赛季,董事会考核你一次;二十年后,用一个固定公式,把二十年攒下的东西折算成一个总分。

这个总分由三块组成:拿过多少荣誉、俱乐部增值了多少、阵容有多值钱。其中增值是主通道,衡量的是一句话:你把俱乐部交回去时,是不是比接手那天更值钱。等于把一家公司交给你二十年,最后只看净资产涨没涨。分数越高,说明你越称职。

这二十年不是一次性的考试,而是一场复利游戏。荣誉逐年累积进总分,前期的错误会复利好几年,但也不是无法挽回,损失能慢慢补回来。所以这场比赛既奖赏耐心,也惩罚短视。

表格最顶端坐着一个特殊角色:特权 oracle,95.54 分。它不是大模型,而是一段脚本,全场唯一被允许直接偷看引擎隐藏状态的脚本。它的动作和其他模型走的是同一套工具,区别只在于它看得见每个球员的真实能力、每个卖家的心理底价。所以 oracle 的分数,是信息完全对称时的能力上限,也是衡量其他模型离全知有多远的那根尺子。

真正夺冠的是 claude-fable-5,90.94 分,摸到了 oracle 的 95%。第二、三名更有意思:开源模型 kimi-k2.6 拿 88.49 分,压在两个 GPT 变体上面,gpt-5.6-terra 86.66、gpt-5.6-sol 86.40。

排名继续往下走。muse-spark-1.1 以 83.19 排第五,glm-5.2 以 83.17 紧咬其后,grok-4.5 81.82、qwen3.7-max 80.66、deepseek-v4-pro 79.15、gemini-3-flash 79.06 依次挤进前十。再往后是 claude-sonnet-5 的 75.75、claude-opus-4.8 的 75.02、gemini-3.5-flash 的 74.59、minimax-m3 的 68.37,最后一名 claude-haiku-4.5 只有 36.90 分。

作为参照,三个盲脚本锚点给出了下限:heuristic 是 17.05,idle 是 -0.90,random 是 -17.21。一个有纪律的固定脚本能拿 17 分,什么都不做是负分,乱动则是最糟的负 17 分。模型们大多站在这些锚点之上,但离天花板还差得远。

这里有个细节挺反直觉:random 比 idle 还差。什么都不做的 idle 是 -0.90,闭眼乱动的 random 是 -17.21。在信息不完全的情况下,乱动比不动更能毁掉价值。管理这件事,做错事比不做事危险得多。

看到这张表,很多人会下意识按老规矩猜排名:比谁模型大、比谁烧钱多、比谁家牌子响。这也正是标题里"最能说的不赢"的意思,那些参数最多、宣传最响、聊起天来最伶俐的模型,未必守得住一家公司二十年。这张表最刺眼的地方,恰恰是这三条规律一条都不成立。

先说规模。kimi-k2.6 是开源模型,权重公开,谁都能下载,结果它排在两家闭源巨头的产品前面。88.49 对 86.66,差距不算悬殊,方向却是反的:更庞大、更受瞩目的模型,没有赢。这就像职场上,资历最深、title 最响的那个人,未必能把一个二十年的项目管好。论文把这点说得很直白:算力是必要的,但远远不够,它是必要不充分条件。

这里得区分两个词:执行和管理。一个模型在问答、推理这类短任务上拿高分,靠的是对单个问题的即时反应;而管理二十年,靠的是对延迟后果的耐心,和对隐藏信息的敬畏。论文要问的,正是模型能不能管理,能不能把一摊事长期管好,而不是只会执行单个任务。两套能力几乎不重叠。

再说价格。论文把每个模型的 token 消耗都记了账,从 gpt-5.6-terra 的 2800 万,一路到 deepseek-v4-pro 的 1.94 亿,差出约七倍。有人猜算力花得多就是多想,多想自然多赢。把 token 和得分摆在一起算相关,四个口径全部贴着零走,分别是 -0.19、+0.07、-0.23、-0.15,p 值都大于 0.38,换成美元计价口径也一样。花得最多的 deepseek-v4-pro 排在第 12 名,而最便宜的那一档里就藏着冠军。多付算力,在这道题里连一分的额外回报都买不到。

最后说厂商。前十名里闭源与开源混着坐:Anthropic 有 fable-5,OpenAI 有 gpt-5.6 的两个变体,Google 有 gemini,xAI 有 grok;开源这边,Moonshot 的 kimi、智谱的 GLM、阿里的 Qwen、DeepSeek 也都在榜。公司出身完全解释不了名次。冠军来自 Anthropic,亚军来自一家开源团队,这个事实本身就把"哪家最贵最强"的叙事打散了。想想也合理:各家实验室优化的都是聊天、推理、代码这些短任务基准,谁也没针对管一家公司二十年专门调过模型,出身优势在这道题上被抹平了。

顺带说一句,kimi-k2.6 这个亚军还有个不显眼的长处:三次运行的标准差只有 0.15,是全场最稳的一个。很多参数吓人、名气响亮的模型,反而波动巨大。稳定本身,在这道二十年长跑里就是一笔资产。

三条规律全部失效,说明这道题考的不是算力,也不是名气,而是别的什么东西。答案要到后面几章才揭晓,这里先记下一句:排名和直觉对着干。

排名表还有一个容易被忽略的细节,就是分数后面跟着的标准差。kimi-k2.6 的波动只有 0.15,几乎每次跑都是 88 分上下;而 haiku-4.5 的波动高达 22.73。波动大也不是垫底者独有的毛病:排第五的 muse-spark-1.1 标准差是 12.03,grok-4.5 是 9.87,qwen3.7-max 是 10.38,前十里也藏着这种忽高忽低的选手。论文里四个模型的波动超过了 20 分,意味着一个漂亮的平均分,可能藏着某一次中途崩盘的惨案。挑模型只看平均值,等于无视它翻车的那一面。这也解释了为什么论文每个模型要跑三个种子,而不是只跑一次就下结论。

更扎心的在后面。如果评估只跑五年,排出来的名单会是另一副样子。论文里 seed 1 那一轨,最好和最差的差距在第 5 年只有 17.2 分,到第 20 年拉大到 37.3 分。早期排名和最终排名的相关系数,第 5 年才 0.19,第 15 年才涨到 0.78。前期大家还在同一起跑线附近挤着,真正的差距要到后程才拉开。

这背后是一个叫信用分配(credit assignment)的问题:一场球输了,该怪前锋还是门将?二十年里哪一步走对了、哪一步走错了,本来就难算清。评估窗口越短,就越只能看到运气,看不到决策质量。所以论文坚持跑到第二十年,就是要让复利和崩盘都有时间现形。

deepseek-v4-pro 就是"早期领先是假象"的活标本。它在第 5 年和第 10 年都是领头羊,最后定格在第 12 名。反过来,最终冠军 fable-5 第 5 年才排第 5。用短一点的窗口去挑最会管理的模型,会挑出一份和真相没什么关系的名单。这给做模型评估的人提了个醒:长周期任务里的短期冠军,可能只是早熟,不是真强。

为什么前五年领先靠不住?因为很多决策的后果要几年后才浮出来。青训、设施、球员成长,都是慢变量;头五年风光,可能是吃老本,也可能是运气,还没到复利兑现或崩盘的时候。短窗口根本看不清这些。

说到底,二十年管理的难,难在后果会复利。第一年埋下的坑,可能第五年才裂开;头五年靠运气吃到的红利,也可能在第十年还回去。短窗口评估看不见这个,所以才会把 deepseek-v4-pro 当成冠军候选。真正能穿越二十年的,是那些每一步都不欠账的人。

榜单两端也很说明问题。垫底的 haiku-4.5 只有 36.90 分,和冠军差了五十多分,中间那一大坨模型挤在 74 到 83 分之间,说明大多数模型其实在同一个水平面上挣扎,真正拉开差距的是两端。

所以真正的问题来了:如果规模、价格、厂商三样都不管用,那到底什么决定名次?论文没有停在排名表上,而是把每个模型二十年的行为拆开,量出六根可以复现的尺子,下一章我们一根一根看。

我看完这张表,第一反应其实是不安。如果连花多少钱、用多大模型都预测不了谁管得好,那我们平时挑模型的那些习惯,是不是从一开始就用错了标尺?冠军离天花板还有多远,fable-5 拿到 90.94,oracle 是 95.54,相当于摸到了 95%。论文给的理论上限约 145 分,说明这个考场远没被做满,前面还有空间。但至少在这一轮里,结论已经清楚:规模、价格、厂商,三个维度都预测不了名次,能打的不是最贵的。这三个结论,每一个都值得单独写一篇,凑在一起就更扎心了。

第 5 章 到底什么管用:六维行为分解

左:四维 Spearman 相关(终局意识 -0.58、资金部署 -0.50、主动控制 +0.45、算力 -0.19);右:每笔签约报价次数(oracle 1、冠军 9、中位 30、最差 73、单种子 133)

总分只告诉你谁赢了,不告诉你为什么赢。fable-5 拿到 90.94,haiku-4.5 只有 36.90,中间差了什么?论文没有停在排名表上,而是把每个模型二十年的行为拆开,抽出六个可以反复观察的维度,再算每个维度和最终得分的相关程度。这六根尺子,比排名本身有用得多。

先说清楚一个前提:这些维度不是论文编出来的标签,而是从模型真实做过的一件件事里量出来的。每次续约提前了几个月、每笔签约报了几次价、账上的现金占净值多少,全都有数可查。输赢背后的行为,是可复现、可诊断的。

那这六个维度是怎么挑出来的?论文把每个可观察的行为都提出来,逐个算它和最终得分的相关,相关高、而且三个种子都稳定的才留下。最后留下六个。这不是拍脑袋,是让数据自己说话。

第一根尺子叫终局意识(endgame awareness)。二十年的局总有结束的一天,聪明的经理会在最后阶段减少那些好几年后才回本的投入,比如设施和青训。论文用末段(第 17 到 20 年)相比中期(第 2 到 16 年)的投资动作率变化来量,和得分的相关是 -0.58,六个维度里最贴分的一个。

注意这个 -0.58 的分量:它比任何资源指标都更能预测名次。规模、价格、厂商全都零相关,而一个行为维度就能解释相当一部分差距。这说明决定输赢的,不是你有什么,而是你做什么。

为什么末期要减投资?因为设施和青训的回报要五六年甚至更久才兑现,而游戏只剩三四年。这时候再投,等于把钱打水漂。能意识到这一点的模型,自然会把资金转向能立刻兑现的地方。

这个维度的相关不是靠运气。论文把三个种子分开算,每个种子都是负号,-0.31、-0.34、-0.28,方向完全一致。一个维度如果换个随机世界就变了号,那它多半是噪音;三个世界都同号,才值得信。

看具体数字就明白有多重要。冠军 fable-5 把设施青训动作从每季 2.4 次降到 0.8 次,gpt-5.6-terra 从 1.4 次降到 0.4 次。gemini-3.5-flash 是反例,它不降反升,从 2.4 次涨到 3.3 次,第 19 年还在兴建设施,等于比赛都快结束了,还往二十年才见效的项目里砸钱。

这就像下馆子快打烊了,还点一桌要炖三小时的汤。汤好不好另说,关键是喝不上了。

终局意识还是长周期评测独有的维度。在短任务里,比如写一段代码、答一道题,根本不存在"快结束了,别投长线"这回事。只有把时间轴拉长到二十年,终局才成为一个需要被意识到的变量。

第二根尺子叫资金部署(fund deployment),通俗说就是钱有没有闲着。论文用赛季末现金占净值的比例来量,和得分的相关是 -0.50。超过 100% 意味着账上闲置的现金,比整个俱乐部折现后的净值还高。

垫底的 haiku-4.5 平均囤着 196% 的闲置现金,glm-5.2 是 135%,opus-4.8 是 134%。冠军只留 80%,全场中位数是 90%。注意一个容易看错的地方:问题不在于花不花钱。论文发现设施投资总额和得分根本不相关,真正的信号是钱是否闲置,不是是否花钱。

论文还专门设了一个机制,防止存钱赢比赛:净值里现金超过三倍年薪账单的部分,只按 0.3 计价。意思是,钱堆在账上,账面上好看,可它不算全值。这个反囤积折扣(anti-hoarding discount),逼着经理去花钱、去部署,而不是当守财奴。

为什么攥着现金这么诱人?因为持有现金是当下最安全的动作,董事会查账时账面好看,什么风险都没有。代价却要几个赛季后才浮出来,那时候机会成本已经收不回来了。用一个生活里的例子:把钱全存银行定期,取不出来,却觉得自己很安全,直到要用钱的那一刻才发现流动性比利息值钱。俱乐部经理攥着现金,本质上是同一种错觉。

这个维度三个种子的相关也是同号,-0.74、-0.60、-0.34。越是把钱囤着不动的,越容易输。

第三根尺子是主动控制(proactive control)。论文看的是续约谈判开启时,合同还剩几个月。和得分的相关是 +0.45。冠军中位数提前 18 个月就动手,只有 4% 的续约拖到最后 6 个月才开。opus-4.8 中位数只提前 10 个月,20% 拖到最后一刻;haiku-4.5 更糟,提前 11 个月、21% 临门一脚。

提前 18 个月和提前 10 个月,差的是什么?是主动性。合同到期是完全可以预见的事件,聪明人早早就开始谈,把主动权攥在自己手里;被动的人要等到火烧眉毛,只能接受对方开的价。这有点像租房续约,房东提前三个月问你续不续,你可以从容比价压价;等合同到期的前一天才想起来,就只能接受房东的任何条件。

这个维度的三个种子分别是 +0.68、+0.18、+0.47,方向同样是正的。提前量这件事,稳定地指向好成绩。它区分的是会做事和会提前做事。

第四根尺子是价格发现(price discovery),下一章会单独展开,这里先看结论:每签成一笔交易,冠军要报 9 次价,全领域中位数是 30 次,最差的 gemini-3.5-flash 要 73 次。这不是市场冷清,是定价能力差。

还有个细节很耐人寻味:同一个 fable-5,在 solo 赛道每季只报 0.5 次价,到了 Arena 竞争场每季要报 4.6 次。市场变挤了,它才知道要多试价。定价能力不是固定的,是跟着环境走的。

第五根尺子是记忆策展(memory curation),也会在后面的章节细讲。这里记住一个结论:冠军的笔记本相似度是 0.39,处在稳定骨架加每季更新的健康区间;而 0.91 的只追加档案、0.20 的全推倒重写,两头都是死路。顺带说一句,模型们的笔记本年末大小从 0.4k 到 209k 字符不等,有人记得太多,有人记得太少,也有人记得刚好。

第六根尺子是算力效率(compute efficiency)。token 从 2800 万到 1.94 亿差七倍,和得分零相关;按每百万 token 换多少分算,冠军和最省的 gpt-5.6-terra 并列第一梯队,烧钱最多的一批垫底。换句话说,赢家是全场最便宜的三家之一,花最少的钱,拿最高的分。

算力这根尺子还藏着个反直觉:烧钱多不是罪,烧钱没回报才是。token 七倍差距零相关,说明多花的那些 token,大概率都浪费在了来回试错上,而不是用在想清楚上。

把这六根尺子叠起来看,赢家的画像就清楚了。它不是某一项最强,而是六个维度都没有明显短板,像一个各科都能过线的学生。中游选手往往是一强一弱,某个维度做得漂亮,另一个维度就露怯,总分被短板拖下去。

这里得说句公道话:均衡不等于平庸。冠军的均衡,是六个维度都过了及格线甚至更高,而不是六科都糊弄。反过来说,中游选手的一强一弱,弱的那项往往是致命的,因为二十年的复利会把短板无限放大。

所以这一章的结论,不是"想赢就去练终局意识"这么简单,而是另一层意思:赢家赢在六科均衡,而不是单科满分。单看任何一个维度,都不足以解释名次;把它们合起来,差距才显出来。

对做模型评估的人,这六根尺子还有个额外的好处:它们告诉你的不是谁输了,而是该改哪。总分说 haiku 垫底,尺子说它的钱闲置了 196%;总分说 gemini-3.5-flash 靠后,尺子说它第 19 年还在建房子。诊断价值,比排名本身高得多。

把这套拆法借用到现实里也成立。招一个能管二十年项目的人,别只看他多聪明、多能说,要看他会不会在收尾前收手、会不会让钱躺在账上睡大觉、会不会提前几个月就把续约谈妥。这些才是能把事情管好的证据。六个维度,说到底是六种可以训练的习惯,而不是什么天赋。

六根尺子里,价格发现这根尤其值得单独拎出来讲。它是全领域最整齐的软肋:最好的模型要报 9 次价,最差的要 73 次,连冠军都躲不开这一关。下一章,我们专门看市场是怎么二十年都教不会模型定价的,那是个更让人哭笑不得的故事。

第 6 章 市场教不会的定价:30 次报价才买来一个人

两个机器人隔谈判桌对坐,桌上足球与筹码,空白气泡代表看不见的隐藏价格

买一个人到底要出几次价?买过房的人都懂,第一次报价几乎不可能成交,得来回几轮,才能摸到房东藏在心里的那个价位。论文把这个过程量化了:每签成一笔交易,模型平均要报多少次价。这个数字,就是价格发现(price discovery)的分数。价格发现,说白了就是通过反复询价、被拒,来逼近市场真正的接受价,是每个经理逃不掉的基本功。

答案让人哭笑不得。特权 oracle 首报价直接成交,1.0 次。全领域的中位数是 30 次。最好的 fable-5 也要 9 次。最差的 gemini-3.5-flash 要 73 次,某个种子下甚至冲到 133 次。想象一下,为一笔转会来回砍价 73 轮,这已经不是在交易,是在猜谜。

先别急着嘲笑。这个数字背后藏着一个更深的发现:20 年里,模型被拒绝了数百次报价,却始终没学会市场价格的边界到底在哪。按理说,被拒一次就该下调心理预期,被拒一百次总该长点记性。可模型没有。

为什么被拒一百次还不长记性?因为反馈本身就是乱的。设想你报 1000 万被拒,你猜对方要 1200 万,于是降到 800 万再试,又被拒,可这一次对方把要价抬到了 1500 万。你收到的信号不是我出低了,而是市场又变了。反馈被自己的行为污染过,模型从中推不出任何稳定的规律。

原因藏在环境机制里,论文把它叫作反适应市场(counter-adaptive market)。你报一个价被拒,卖家不会明说自己的底价,反而会悄悄把隐藏的要价抬高。你越是锲而不舍地还价,对方越是往上涨。这就像菜市场里的摊主,发现你总在他家买,就悄悄把价往上抬,你还以为是自己砍价不够狠。

这个反适应市场,至少有三个不怀好意的机制。被拒的报价会抬高隐藏要价;跟同一家俱乐部反复交易,价也会被抬起来;谈判时刷屏还会触发冷却。三条加起来等于一句话:没有哪个固定策略能一直保持最优,赢球的招数用多了,市场就学会了对付你。

谈判还有冷却:同一个停点里能谈的次数是有限的,谈崩了还得等。越急越谈不拢,越谈不拢越急,恶性循环就这么转起来。

重复交易也是坑。你跟同一家俱乐部做了几笔买卖,对方摸清了你的预算和急切程度,下一笔就专门为你抬价。熟客不但没有优惠,反而被当成最肥的羊。

这跟股票市场、二手平台完全不是一回事。那些市场里,价格大致是公开的、静态的,你多看几眼行情就心里有数。这里没有行情,价格是活的,会记仇,会报复你的每一次还价。

换句话说,模型把市场当成一台静态的机器,以为多试几次总能撞对参数。可市场是一群会记仇的对手,它在根据你的行为实时调整自己。你上一轮暴露出的急躁,就是它下一轮涨价的理由。

这不是市场冷清,是定价失败。论文里的方向很明确:所有模型都低估了会涨价的市价。不是没人卖,是模型根本不知道该怎么出价、出到哪停。

这里有个活生生的案例。一个中档模型去买人,球员年薪从 1200 万被一路抬到 1400 万、1700 万、1800 万,模型照单全收。设想一下那个谈判现场:你要买一个前锋,对方开价 1200 万年薪,你还价,对方加到 1400 万;你再争取,变成 1700 万;最后成交 1800 万。整个过程中,你没有一次判断出这个球员到底值多少,只能一路接受对方越抬越高的数字。

同一类模型还有更惨的下场:工资支出超过了收入,直接把自己搞到破产。不会定价的人,最后不是买贵了,是把自己买没了。

设想一个理想经理会怎么做:第一次被拒后,不盲目加价,而是换一个相似位置的球员再询价,用几个锚点拼出市场的大致区间,再回头出价。说起来简单,真做起来是另一回事。

为什么模型这么难学会定价?回头想想隐藏信息(hidden information)这个设定就明白了。球员的真实能力、卖家的心理底价,从一开始就对所有人隐藏。球探返回的只是一个带永久偏差的区间,你永远看不到那个真相。这跟二手车市场一模一样:卖家知道车有没有泡过水,买家只能靠试驾和检测去猜。信息天然在卖家手里。

可 oracle 却能首报价成交。它唯一的不同,是能直接偷看隐藏状态,知道卖家的真实底价。这一对比就说明:定价差的根源不是嘴笨、不是不会算,而是信息不对称。oracle 的 1.0 次报价,恰恰证明不是市场不给成交,而是信息对称的人一步就能到位。模型看不到底价,又学不会从被拒里反推底价,于是永远在瞎猜。

也别以为冠军就多会砍价。fable-5 也要 9 次才成交,比 oracle 的 1 次差了八倍。连最好的模型都在这一项上大失水准,可见这不是个别选手的毛病,是整个物种的短板。

可这个短板不是不能补。冠军 9 次、最差 73 次,中间差出八倍,说明定价这件事是有高下之分的,只是大多数模型都没摸到门。

更耐人寻味的是,同一个模型,换个市场,定价表现立刻不一样。fable-5 在 solo 赛道每季只报 0.5 次价,到了 Arena 竞争场,同样的模型每季要报 4.6 次价。市场变挤了、对手变凶了,它就知道得更用力地试价。

这说明模型不是完全没有定价能力,而是它的定价策略高度依赖环境。在温和的 solo 世界里,它轻轻试一下就能成交;到了乱成一锅粥的 Arena,它得多试九倍。定价能力不是一个固定的开关,是跟着环境伸缩的肌肉。

这也是为什么同一个人在不同市场表现天差地别。定价不是背下来的价目表,是一种对环境的实时判断。环境一换,肌肉记忆就失灵。

再看看 Arena 里的行为账本,更能看出报价次数背后的东西。冠军 fable-5 二十年只报了 91 次价、做了 1315 个动作,每一步都攒在一条长期计划上。而 gemini-3-flash 报了 452 次价、2642 个动作,笔记本每个危机都要推倒重写,永远在救火。报价次数不是勤奋的勋章,是迷路的里程表。

人类玩家在这里也没讨到便宜。六个第一次玩的人,普遍反映看不见卖家接受价,根本判断不出该出多少。定价这件事,对人和对模型一样难,因为难的不是计算,是猜一个被故意藏起来的数。

人类被解雇的那几位,栽的坑和模型高度重合:看不见卖家的接受价、工资账单拖了几季才到账、出了事不知道该怪哪一步。定价这场考试,人和模型坐在同一张难卷子上。

这件事放到现实里其实很要命。今天已经有一堆公司想用大模型做定价、做采购、做自动谈判。如果模型连一个模拟的足球转会市场都谈不下来,被拒一百次还不长记性,那把它扔进真实的价格谈判里,多半只会被对方牵着鼻子走。

反过来想,一个真能定价的 Agent 值多少钱?它能替采购砍价、替销售定价、替投资做估值。前提是它先学会从被拒里读出信息,而不是被拒一百次还在原地震。

我看这一章最大的感触是:我们总以为谈判靠的是口才和气势,可这里的证据指向相反的方向。真正决定成交效率的,是能不能从一次次被拒里,慢慢拼出对方不愿说出口的那个数。

把这一章收起来,结论就一句:定价是模型集体的软肋,二十年、数百次被拒,都没教会它们市场价在哪。市场不是一张标好价格的菜单,它是一个会随着你的出价悄悄涨价的对手。想在这道题里赢,光会算账不够,还得会从被拒里读出信息。这条教训,值得所有想用 AI 做生意的人记在账本第一页。下一章,我们把镜头转向一个更安静、也更致命的东西:模型自己的记忆。

第 7 章 记忆的两种死法:只追加的档案,和每季推倒重写

笔记本相似度-得分散点:只追加 0.91、全重写 0.20 / 0.23、赢家 0.39、垫底 haiku 0.31;灰色带为赢家所在 0.30-0.40
机器人坐在大笔记本前,左边档案塔、右边碎纸飘散,象征记忆的两种死法

想象你是一家足球俱乐部的经理,但规则很古怪:每个星期上班,你的大脑都被清空一次。上一周谈妥的转会、对某个年轻球员的五年规划、决定夏天卖掉的那个前锋,全部消失。你唯一能依靠的,是上星期下班前自己留在抽屉里的一张便签。这就是 FM-Bench 给每个模型安排的处境。

在论文的设计里,每个决策停点(decision stop)都是一次全新的对话,聊天记录不保留。模型跨过停点唯一能带走的,是一本它自己写的笔记本(notebook)。引擎会免费把联赛位置、现金、董事会信心这些"当前状态"推给模型,这些不用记。真正需要模型自己写下来的,是意图:为什么买这个人、计划冬天卖掉谁、下赛季把预算押在哪。

笔记本只有两个写操作:追加一条笔记,或者整体重写。写进去的内容,会在接下来每一个决策停点里原样注入,成为模型"想事"的起点。于是,模型记得什么、忘掉什么、把什么留在纸面上,就成了一种选择。记忆策展(memory curation)本身,成了被测试的能力。

模型一共有四层记忆。第一层是引擎自动注入的当前状态包;第二层是可查询的完整历史档案(archive),只读、要主动去查;第三层是审计日志,记录每一个动作,但永远不给模型看,只用于回放和防作弊。第四层,也就是唯一承载意图的那一层,才是笔记本。四层里只有笔记本真正属于模型,也只有它决定了一个模型记得什么。

这四层的分工很细。历史档案可以查,但要模型主动去调,它不会自己跳出来;审计日志干脆连看都不给看,因为一旦模型能读自己的操作流水,它就能靠"我记得刚才做了什么"作弊,破坏"每个停点都是全新对话"这个前提。笔记本是唯一允许模型自由改写的一层,所以它天然成了记忆策略的战场。

为什么要把记忆逼到这么狠?因为 20 个游戏年产生的历史,超过任何模型的上下文窗口。有人会问,为什么不直接把窗口开大?答案是开不动:20 个赛季、几百个停点、几千次工具调用,最长的窗口也装不下,成本还会爆炸。所以问题不是"要不要忘",而是"怎么忘得聪明"。遗忘是不可避免的,论文的做法是让遗忘显式、有界,并且归模型自己管:所有模型面对同一份契约,差别只在它们选择写什么、怎么写。

这套设计里藏着个漂亮的闭环。上下文装不下二十年,所以必须靠笔记本;笔记本是唯一能自由改写的状态,所以记忆策略成了可测的变量;一旦可测,两种死法和一种活法就第一次清楚地浮出水面。这也是论文最妙的一手:把"记忆"这件听起来很玄的事,变成了一个能用 0 到 1 之间的数字衡量的东西。

于是出现了两种典型的死法。

先看衡量的那把尺子:笔记本相邻两个赛季末快照的 TF-IDF 余弦相似度。1 表示一字不改,0 表示彻底重写。它量的是"这个模型有多爱改自己的笔记"。

第一种死法,是把笔记本当档案库,只追加,从不删改。gpt-5.6-sol 的相似度是 0.91,几乎只往里加东西。20 年的记录堆在一起,当年那句"计划冬天卖掉 Y"还在,但它淹没在几百条过时信息里,当下的状态反而找不到了。设想你翻一本二十年没整理过的笔记本,想找"我上周决定卖谁",结果前面几十页全是十年前某场谈判的复盘。档案很全,人很迷茫。

第二种死法,是每季推倒重写。claude-sonnet-5 的相似度只有 0.20,qwen3.7-max 是 0.23,等于每个赛季末把笔记本几乎全撕了重写。后果是:任何跨赛季的计划都活不过一个夏天。你刚写下"未来三年重点培养青训",下个赛季这份计划就被新笔记覆盖了。计划从不落地,因为它根本活不到落地那天。

设想你同时给两家公司做财务顾问。甲每次开会都带同一本厚文件夹,从第一年攒到现在,从不清理;乙每次都换一份新的两页纸,上一季的目标一个字不剩。半年后,甲还在翻去年的旧账,乙还在重新定目标。两边都成不了事。这就是那两种死法在现实里的样子。策展的本质,是判断什么信息会过时、什么信息要长留,这个判断能力比写多少字更值钱。

赢家 claude-fable-5 走的是中间路线,相似度 0.39,而全体模型的中位数是 0.31。它保留一个稳定的策略骨架,每季只更新状态那一块:谁涨球了、谁该卖了、董事会现在最在意什么。骨架不动,血肉常新,这就是"骨架稳定、状态更新"。

但这里有个很容易误读的地方:处在中间值,不等于就能成功。claude-haiku-4.5 的相似度也是 0.31,跟整体中位数几乎一样,它却在排行榜垫底,只有 36.90 分。记忆策展做得"看起来正确",只说明你没犯那两种明显的错,不代表别的维度也过关。记忆是必要不充分。

那有效记忆到底长什么样?论文把它拆成三层。事实层是引擎自动记录的、不可变的,比如合同和伤病;计划层是"我想干什么",要稳定但可修订;状态层是"现在到哪一步了",要每季更新。只追加的模型把三层搅成一锅历史,全重写的模型连计划层也一起撕了。赢家恰好三层都照顾到。

拿一个具体的转会举例。事实层记的是:这位中卫合同还剩两年,周薪多少。计划层记的是:我打算冬天之前把他套现,因为他的伤病倾向一直在涨。状态层记的是:已经有两家俱乐部询价,其中一家出价偏低。三层分开写,每季只需要动状态那一小块;三层搅在一起写,一改就全乱。分层和混写的差别,二十年下来就是冠军和垫底的距离。

还有一个更扎心的发现,藏在 claude-opus-4.8 的笔记本里。它在第 10 个赛季写下"闲置现金应该投入质量",在第 19 个赛季写下"储备被折现了,应该转成年轻球员",两条都写对了。可最终结算时,它手里还攥着大约 2100M 的闲置储备,赛季末现金平均是净值的 134%。它知道该做什么,也写下来了,就是没做。论文管这个叫知道-做鸿沟(knowing-doing gap)。写对和执行,是两种能力。

这件事细想挺吓人的。我们通常以为,模型写得出来的,就说明它懂了;懂了,就会去做。但 opus-4.8 给出了反例:写下正确判断,和把这个判断变成每个停点里的动作,中间隔着一大段执行纪律。规划能力和执行能力是两种不同的能力,后者在长周期里更稀缺。

这条鸿沟在竞技场里看得更清楚。同样面对危机,gemini-3-flash 的做法是每遇到一次危机,就把笔记本重置成当下赛季的"本地救火"方案,救完火再推倒,再救火,20 年里发了 452 个报价、做了 2642 个动作,忙得不可开交,分数却不高。赢家则是 20 年一个累积计划,91 个报价、1315 个动作,稳稳走完。忙,不等于对。

还有一点,笔记本的体量差异也能说明问题。到第 20 年结束时,有的模型笔记本只有 0.4k 字符,最多的堆到 209k 字符,差了五百倍。整个 20 年,模型平均往笔记本里写了 354 次。体量本身不说明好坏,只说明每个模型对"未来自己需要知道什么"的判断天差地别。设想一家真俱乐部,档案柜塞满二十年剪报,和一本薄薄的、只有三页但每页都写着关键决策的手册,哪个更可能帮你赢?

说实话,我看完这一章,最先记住的不是那些相似度数字,而是那本只有 0.4k 字符的笔记。一个模型二十年里只留下这么点东西,居然还能活下来,靠的恐怕不是记得多,而是记得准。这跟人没什么两样。回头看整个设计:20 年的历史塞不进任何窗口,所以模型必须学会遗忘。笔记本这个机制,把"遗忘什么、记住什么"变成了一道显式的、有界的、只属于模型自己的题。你记下的东西,决定了你是什么样的人。对一家俱乐部来说,你记下的东西,决定了你二十年后的账本。

第 8 章 人类上场:最好的新手排在模型榜末尾

左右分屏:戴帽机器人持空白纸 vs 金属机器人持全息面板,蓝色光线相连

论文没让模型自娱自乐,它还找了 6 名人类玩家,第一次接触这款游戏,跑同一条 solo 赛道。结果有点残酷:4 个人中途被董事会解雇,只有 2 个人撑完了 20 个赛季。撑完的两个,分数是 74.64 和 59.95。

74.64 这个成绩,和 gemini-3.5-flash 的 74.59 几乎持平,比冠军 claude-fable-5 的 90.94 低了 16 分。换句话说,最好的首次人类选手,排在模型榜的底部。

这话得细品。排在模型榜底部,不等于"人不如机器"。那些模型每个都跑了 3 个 seed、几十次完整赛季,经验是人类玩家的几百倍。而人类是第一次玩,手忙脚乱地撑过几百个停点。拿一个新手的一次发挥,去和几十次打磨过的机器均值比,本来就该输。真正有意思的是:输的姿势和模型一模一样。

从方法上讲,人类对照给的是一个"难度锚点"。如果最强的新手都能轻松拿 90 分,说明这个游戏对模型太简单,测不出差距;如果人类全军覆没,又说明游戏难得不切实际。6 个人、2 个完成、最好 74.64,这个分布恰好落在"难但能玩"的区间,让模型的成绩第一次有了参照系。

先说人类为什么难。6 个玩家都是第一次玩,没有模型那种 26 个工具随便调、几千万 token 随便烧的待遇。被解雇的 4 个人,解雇时点分别在 t=10.8、10.7、7.8、12.3,都死在中段。更要命的是,4 个人全都低于 heuristic 纪律脚本的 17.05 分锚点。

四个解雇时点有个共同点:都集中在第 7 到第 12 个赛季,没有人死在开局,也没有人拖到最后。开局时大家靠新鲜劲撑过去,到中段,前期的错误开始复利,现金、阵容、信心的窟窿一起爆发,解雇就成了大概率事件。

还有个小细节:两个完成者都是零死亡,没被解雇、没破产、没放弃,实打实跑完了 20 年。光这一条,就超过了 heuristic 脚本在 9 次运行里 7 次中途死掉的表现。能活着走完全程,本身就是个门槛。

这里得先把标尺摆正。论文放了三个脚本锚点当固定刻度:heuristic 是照着简单纪律机械执行的脚本,17.05 分;idle 是什么都不做,-0.90 分;random 是乱动,-17.21 分。random 比 idle 还差,说明瞎折腾比躺平更毁价值。而 4 个被解雇的人类,连 heuristic 那条机械纪律线都没到。

但人类也有模型没有的本事,而且恰恰是模型最缺的那几样。论文归纳了三点。第一,人类会从经验里推导出固定规则,然后坚持执行,模型却容易被每次谈判的新情况带跑。第二,人类发现自己的策略失败后,会在中途主动修订,而不是一条路走到黑。第三,人类会自己造外部工具,比如用表格记录那些引擎没有直接显示的隐式状态,来补足看不到的信息。

设想一个玩家前半程死守"只买便宜货"的策略,结果发现便宜货全是隐藏的伤病炸弹,于是他中途把规则改成了"便宜可以,但先查伤病史"。这种"发现规则失效就当场修订"的动作,模型很少做。模型更常见的是带着同一套定价逻辑从头买到尾,20 年里被拒了几百次,也没改。

还有一个更直观的例子。设想一个玩家发现引擎不直接显示"我还有多少预算押在工资上",于是他开了一个自己的表格,每签一笔都记下来,靠这个外部账本推断现金流的走向。这种"用工具补看不见的状态"的做法,模型里没有一个自发做过。模型只会调引擎给的 26 个工具,不会自己再造第 27 个。

这三点放到模型的六维行为分解里看,简直是对症下药,模型缺的正是主动控制(续约总拖到最后一刻)、价格发现(30 次报价才买来一个人)和记忆策展。人类赢在这些"软"的地方,输在体力、算力和海量信息处理上。

如果把人类的三样本事和六个行为维度对个号,会发现很工整:推导并坚持规则,对应主动控制;中途修订失败策略,对应终局意识和资金部署;造外部工具补隐式状态,对应记忆策展和价格发现。人类强的地方,恰好是模型在六维矩阵里得分最低的那几格。

更值得玩味的是,人类的失败模式和模型几乎一样。把玩家报告摊开看,四条抱怨其实是四个不同的坑:看不见卖家的接受价,是价格发现的问题;误判哪些错误不可挽回,是长期归因的问题;工资账单几季后才到,是延迟反馈的问题;不知道该怪哪次决策,是信用分配(credit assignment)的问题。四条加在一起,等于把前面几章讲过的模型软肋,在人类身上原样重演了一遍。

玩家说的"误判哪些错误不可挽回",背后是游戏的累积后果机制:青训和设施的投资要几年后才回报,一次失误的代价会滚很多年。人类和模型一样,很难把今天的坏结果,归因到三年前那个看似无关的决定上。

最让我意外的是,人类和模型的失败清单居然对得上。第七章那个 opus-4.8 攥着 2100M 现金不花的毛病,人类新手也有:钱堆着不动,当下最安全,代价几个赛季后才找上门。工资账单延迟到账这件事更典型,等账单到了,才发现前几季的"节省"全是幻觉。人类和模型栽在同一个坑里,说明这个坑是游戏本身挖的,不是谁脑子不够用。

具体到两个完成者。H1 用了 394 个决策停点、10 个小时,H2 用了 398 个停点、只花了 4 个小时。时间花得多不代表分数高,H1 比 H2 高 15 分,却多花了 6 个小时。快不一定是好事,慢也未必是坏事。真正决定分数的是那几百个停点里,有几个做对了关键选择。这跟模型里 token 花得多、分数反而一般,是同一类现象。

设想一个更聪明的人类玩家:他第一年就把"续约提前 18 个月"写进自己的规则,第二年发现现金闲置就立刻转投年轻球员,第三年用一个外部表格盯住每一笔工资。这样的选手能不能进模型榜前十?论文没测,但它留下的数据让人很想试一试。

论文把人类对照放进来的用意很清楚:它不是要证明 AI 比人强,而是要给模型榜一个"人味"的刻度。最强的首次人类选手落在模型榜底部,说明这款游戏对新手确实很难,模型能跑完 20 年、能赢分,不是一件理所当然的事。

同时它也说明,人类那三样本事,恰好是可测的、可补的方向。为什么人类能从零推导规则,模型反而难?一个合理的猜想是:人类面对一堆杂乱信息时,天然会找模式、立规矩,而模型更擅长在给定规则下执行。足球经理这种长周期任务,恰恰是"规则从哪来"比"怎么执行"更重要。模型擅长不疲倦地处理 20 年、几百个停点的海量状态;人类擅长设定规则、识别策略何时失效、在关键时刻跳出来修订。把这两者拼起来,是论文留给未来的一条可测的路。

我个人最想看到的,正是这个方向。设想一个具体的分工:人类每周看一次全局,定下"未来三季重点是什么",写进一个共享计划;模型照着这个计划跑日常的几百个停点,只在计划明显失效时,把异常标出来等人处理。这样人类的"推导规则、中途修订"和模型的"海量状态、不知疲倦"就能拼在一起。论文没做这个实验,但它把路标了出来。这未必是科幻里的"人机融合",倒更像一个资深经理,配一个永不喊累的分析师。

这条路的可测性,来自论文已经搭好的骨架:人类和模型在同一个引擎、同一套计分、同一条赛道里跑。要做人机配对实验,只需要在某个停点里加入"人类监督员"这个角色,其余一切照旧。成本不高,答案却可能很值钱。说到底,人和机器本来就不是同一场考试里的对手,而是同一支球队里的两个位置。

第 9 章 对我们意味着什么:长周期 Agent 的三个启示

二十个赛季的足球经理考试,考出的其实是一件事:让一个智能体长期自主地管理复杂事务,到底难在哪。对正在做自动化运营、自主管理类 Agent 产品的人来说,这篇论文给的不是一个模型排行榜,而是三条可以直接搬走的启示。

第一条,评估长周期 Agent,不能用短期任务。

大多数现有基准测的是"这一刻你答得对不对":写一段代码、答一道题、完成一次交互。但真实的管理是延迟反馈的。持有现金、按兵不动,在当下永远是安全的动作,甚至看起来像谨慎。它的代价要几个赛季后才浮出来,等闲置现金拖累了净值,你才明白当年的"稳"其实是"懒"。

论文把这个问题量化得很清楚。资金部署这个维度,量的是赛季末现金占净值的比例:claude-haiku-4.5 平均是 196%,glm-5.2 是 135%,claude-opus-4.8 是 134%,而赢家只有 80%。超过 100% 意味着什么?意味着它手里闲置的现金,比整个俱乐部的折现净值还多。而那个写下"该把现金投出去"的 opus-4.8,最后还是攥着 2100M 储备直到结算。

为了逼模型把钱花出去,论文甚至在计分里埋了一个反囤积折扣(anti-hoarding discount):现金超过三倍年薪账单的部分,只按 0.3 计价。也就是说,钱堆着不算数。可即便如此,还是有模型宁可吃这个折扣,也要把钱攥在手里。为什么?因为花错的代价当场可见,不花的代价几年后才显现。延迟反馈,是长周期 Agent 的第一道坎。

这里藏着一个更普遍的道理:在长周期系统里,"不行动"永远比"行动"显得安全,因为不行动的代价被推迟了。任何只奖励当下正确、不惩罚未来代价的评测,都会系统性地偏爱不动弹的 Agent。这才是"不能用短期任务评估"的深层原因。

更隐蔽的问题是,短期评估会给出错误的信心。论文里 deepseek-v4-pro 第 5 年和第 10 年都领先,最终排第 12。如果你在它前五年表现最好的时候上线了它,你会得到一个看起来很棒的 Agent,和一个半年后崩掉的系统。

所以给产品的第一条建议是:别拿即时问答去评一个要跑三个月、半年的 Agent。要专门设计"延迟反馈"的题目。设想你给一个自动采购 Agent 出一道题:"三个月后,你的现金持有量会不会超过安全线?" 这不是让它现在做对什么,而是让它为三个月后的自己负责。信用分配(credit assignment),也就是把坏结果归因到正确的那个决定,才是长周期评测真正该测的东西。

第二条,记忆系统要分层,而且要可重写。

第七章已经讲过两种死法:只追加的档案,和每季推倒重写。这里补一句产品视角的结论:给 Agent 的持久记忆,要显式区分三层。事实层,系统自动记录,不可变;计划层,稳定但可修订;意图层,也就是"我打算做什么、为什么",要单独存、单独让执行回路去读。

拿数字再说一遍:gpt-5.6-sol 的笔记本相似度 0.91,只追加,现状淹在历史里;claude-sonnet-5 和 qwen3.7-max 只有 0.20 和 0.23,每季全推倒,计划活不到落地;赢家 fable-5 是 0.39,骨架稳定、状态常新。两极都死,活路在中间偏"稳"的那一侧。

有人会问,意图层和计划层有什么区别?计划是"这个季度做什么",意图是"为什么做、做到什么程度算够"。计划会过期,意图不会。一个 Agent 换了十个计划还能活,但丢了意图,就只会原地打转。

为什么意图层最容易被漏掉?因为工程上它最难量化。事实有数据库,计划有任务清单,意图却是一句"冬天把 Y 卖掉"这种带理由的软信息。可论文里 opus-4.8 的教训正好卡在这里:它写下了正确的意图,执行却没跟上。记忆分层的核心,不是存得多,而是让意图层真正参与每一个决策。

设想你搭一个客户服务 Agent 的记忆。事实层放客户的历史订单和合同,永不改写;计划层放"这个季度重点挽回流失客户",一季一改;意图层放"为什么优先挽回这个客户,而不是那个"。三层分开,改计划时就不会把事实和理由一起冲掉。

第三条,用行为指标做诊断,而不是单一分数。

总分只告诉你谁输了,不告诉你该改哪。论文给的六个维度才是真正有用的东西,而且每个都能落成一个可复现的测量:终局意识(和最终分数的相关 rs=-0.58,最贴分)、资金部署(rs=-0.50)、主动控制(续约提前量,rs=+0.45)、价格发现、记忆策展、算力效率。

价格发现看每笔签约的报价次数,中位 30 次、最好的也要 9 次,这个数字高就说明它在议价上浪费动作;记忆策展看笔记本的相似度,0.91 是只追加、0.20 是全重写,都不好;算力效率看每分 token,赢家恰好是三个最便宜的模型之一。六个维度里,任何一个都能单独拎出来当报警器。

拿终局意识举例。gemini-3.5-flash 在第 19 个赛季还在建慢回报的设施,赢家则把这类动作从每季 2.4 次降到 0.8 次。同样是在花钱,一个是在收尾前埋下永远收不回的种子,一个是知道游戏快结束了、及时收手。这个区别,短期任务里根本测不出来。

设想你有一个自动运营的 Agent,上线后总分还行,但你怎么知道它会不会在半年后崩掉?你可以盯它有没有终局意识,是不是在收尾前还在做慢回报的投资;盯它的资金部署,是不是攥着预算不花;盯它续约的提前量,是不是每次都拖到最后一刻。这比看一个综合分有用得多。

把三条启示拧成一份给自动化产品的清单,大概长这样:第一,评测里至少放一道"延迟反馈"的题;第二,记忆拆成事实、计划、意图三层,意图层单独存、单独读;第三,上报行为指标,而不是只报一个总分。三条都不难,但大多数产品现在一条都没做。

设想你把这套清单套到自己项目上:先翻翻现有的评估集,数一数里面有几道题要等三个月才能见分晓;再看看 Agent 的记忆,是三个字段还是一大坨聊天记录;最后问自己,团队看的是总分,还是那几个能定位问题的行为指标。三问下来,多半会发现前两条是空的。

这些启示之所以敢拿来指导实践,是因为它们立在一个可信的地基上。整个评估跑在确定性引擎里,同 seed 同动作必得同结果,可逐位重放;最终分数完全由机制累计,没有 LLM 裁判、没有人类打分。这里没有"我觉得这个 Agent 表现不错",只有"它在第 19 个赛季还在建设施"这种能查证的事实。

还有个数字值得记住:赢家 fable-5 只到了 oracle 的约 95%,而整个计分的上限大概在 145 分,远未饱和。意思是,最好的模型也还留着一大截可进步的空间。这三条启示不是"满分答案",更像是给后来者的一张还空着很多格的答题卡。

论文自己留了几个未来方向:人机配对(第八章讲过的监督员角色)、笔记本的消融实验(拆掉某些记忆层看分数掉多少)。这都不是科幻,是把同一个引擎再跑几遍就能做的小改动。

我还想补一句自己的看法。这篇论文最打动我的,不是哪个模型赢了,而是它证明了"管理"这件事可以被测。我们天天在管预算、管人、管时间表,却很少把它当成一个能打分、能重放、能审计的对象。一旦它可测,改进就有了抓手。如果你恰好在做自动化运营、自主客服、智能投放这类产品,这三条可以直接抄;如果你只是关注 AI 的读者,至少可以带走一个判断标准:下次看到"我们的 Agent 在某某榜上拿了高分",先问一句,那个榜是即时问答,还是让它跑了二十个赛季。一句追问,往往比一个榜单更能帮你判断它靠不靠谱。这也是我从这篇论文里,最想带走的一个习惯。

延伸阅读:

  • FM-Bench 论文:https://arxiv.org/abs/2608.18423
  • 代码:https://github.com/Analogy-AI/fm-bench

延伸阅读

  • 论文:FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents(arXiv:2608.18423),https://arxiv.org/abs/2608.18423
  • 代码与复现:https://github.com/Analogy-AI/fm-bench
  • 相关论文:
  • Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL(arXiv:2608.17253)
  • SPADE: Self-Play in Adaptive Synthetic Executable Environments(arXiv:2608.19197)
  • SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents(arXiv:2608.18852)
  • Credit Without Ground Truth: Auditing Step-Level Credit Assignment in LLM Agents(arXiv:2608.19760)
  • YC-Bench: Benchmarking AI Agents for Long-Term Planning and Consistent Execution(He et al., ICML 2026 Workshop)