你给 Agent 配了长期记忆、技能库、会话历史,让它"越用越懂你"。跑了一个月,它真的变聪明了一点——但有多少提升,是那些存下来的经验真正贡献的?

8 月初,一篇叫 PAST-Bench 的论文(arXiv:2608.04003)把这个问题摊开来测了。结论不太客气:提升是真的,但很多提升根本不走你以为的那条路。

人形机器人站在档案架前,多数抽屉紧闭,经验存了却没被取用

图:经验存下来了,但多数时候没人来取——这正是 PAST-Bench 要验证的落差。

把记忆开关关掉,重跑一遍

个人 Agent 框架——比如 Hermes、OpenClaw 这类——现在都把持久化当一等公民:记忆、技能文件、会话索引,跨会话保留。宣传口径都是"从经验中学习"。

PAST-Bench 的做法很直白:每个任务先开着持久化跑一遍(论文里叫 w/-evolve),再关掉持久化原样跑一遍(w/o-evolve)。同样的提示词、同样的评分器、同样的工具栈、同样的随机种子。两遍的分数差,才算得上"经验带来的提升"。

光这样还不够。他们又塞进四类对照任务:删掉先前状态的空白对照、塞入无关信息的干扰对照、留着过时记忆的陈旧对照、以及把经验写错地方的错误机制对照。只有提升越过了这些对照设的上限,才承认这是真正的自我进化。

整个基准铺了 26 个场景、204 个任务,覆盖四种能力:记忆(存一条偏好,之后能不能查出来)、程序复用(学会一套操作流程,之后能不能照着执行)、信息检索(答案已经躺在库里,该查的时候会不会去查)、更新(新规则能不能覆盖旧规则)。跑了 7 个基座模型、4 个 Agent 框架,共 28 组组合。

PAST-Bench 的整体设计:任务家族序列 + 开关持久化的匹配对照

图:PAST-Bench 的评测结构。早期回合存下经验,后期回合在全新会话里测试复用,对照组负责排除"走捷径"的解释。

分数涨了,账本对不上

先看让人松一口气的部分:开着持久化,分数确实更高。28 组组合里,绝大多数都有正的提升,有些涨得还挺明显。"经验有用"这件事,没有被推翻。

但论文引入的第二个指标把气氛变了。他们叫它机制证据分(Mech score):不只看最后分数,还去翻运行轨迹——模型到底有没有写下记忆、有没有检索技能、有没有在正确的时机调用会话索引。

结果发现一批"分数涨了、账本对不上"的组合:后期任务表现更好了,但轨迹里找不到走持久化通路的痕迹。也就是说,提升可能来自任务本身的提示残留、模型的上下文外推,或者别的什么,唯独不是框架宣称的那套记忆机制。论文原话的意思很扎眼:一个写了产出物却从来不读的 Agent,不该只凭分数差拿学分。

这件事对选型的意义比看起来大。如果你只跑一遍任务、只看最终得分,你会给两个框架打出差不多的分;只有把轨迹拆开,才能看出一个的经验回路是真在工作,还是摆设。

阿里云可观测团队 8 月写 DeepSeek Harness 的那篇文章里有一句话,正好对上这个处境:DSH 自带的 Session 日志是 append-only 的事件流,包含 Turn、Step、工具调用,"非常适合审计、回放和事实排查,但日志与 Trace、Metrics 解决的是两类不同问题"。要回答"提升到底从哪来",你得有带父子关系的调用树,而不是一串按时间排列的事实。

更新,是最难的一环

四种能力里,最弱的是更新。

这符合直觉,但弱得比预想厉害。场景长这样:库里先有一条旧规则——比如"报销要用 A 流程";后来用户明确说"以后都走 B 流程";再往后开新会话问报销。正确的行为是用 B、并且让 A 彻底消失。实测里,大量框架要么还在用 A,要么 A、B 混着用,旧状态像幽灵一样泄漏出来。

对要上生产的团队,这是最要命的一类失败。业务规则会变、接口会改、配置会迁移,Agent 若守着三个月前的过时做法不放,比没有记忆还糟。

四种能力维度的任务分布与评测路径

图:PAST-Bench 把记忆、程序复用、信息检索、更新拆成四条独立通路分别施测,"更新"一条在多数框架下垫底。

先诊断,再开药

论文没有停在拆台上。他们按诊断结果给 Hermes 打了五个补丁,得到 Hermes+,每个补丁对准一个查出来的病灶:会话结束时的经验收口(closeout)、写之前的检索门控、更新时的旧状态清除,等等。

效果数据值得抄下来:整体提升 Δ 从 +0.13 抬到 +0.15,机制证据分从 0.64 升到 0.73。单看更新维度,五个补丁叠加后 Δ 达到 +0.24,明显高于任何单个补丁——单独收口是 +0.16,单独检索门控只有 +0.06。也就是说补丁之间有超加性,组合拳大于各部分之和。

同时论文很诚实:整体 Δ 的差距和重复运行的波动幅度差不多,改进是"能力相关、模型相关"的,不是一把通吃的银弹。

这条"先观测、再归因、最后动手改"的路径,和工程侧的进展是互相咬合的。我们此前梳理过一份"四块拼图"的框架——轨迹要可信、对象要可改、验证要可靠、优化器要从失败里学习——DeepSeek Harness 把主循环本身做成插件,摊开了前三块的底座,唯独没交"会学习的优化器"。PAST-Bench 这类基准补的正是"验证要可靠"那一块:给优化器一个不撒谎的计分板。

源势AI怎么看

我们在能源和金融客户那里落 Agent,最常被客户问的一句话是:"它是不是越用越聪明?"以前我们只能拿案例说话。PAST-Bench 这类工作给了一个更硬的答案方式:关掉记忆重跑,看差距;翻开轨迹,看路径。

三条实操判断:

第一,经验层的钱不能白花。持久化不是开了就有收益,"存了没人取"和"更新了旧的还在"是两种真实存在的失败模式,选型时要分别验。

第二,可观测先于自我进化。没有调用树和机制归因,你分不清"变强了"和"碰巧对了"。我们的交付标准里,Trace 先行、日志兜底,这条在 Agent 时代只会更硬。

第三,更新能力要单独测。别把"能记住"当卖点,"能改掉记错的"才是生产可用的门槛。

(本文参考:PAST-Bench, arXiv:2608.04003;阿里云云原生《DeepSeek Harness 全景可观测实践》2026-08-17;KimKB 笔记《Agent 自进化的四块拼图》2026-08-18)