首个系统性研究AI「文件夹记忆」的论文发现:整理能省一半检索成本,却买不来更好的答案
导读:全世界的AI都在用文件夹当记忆,但从没人检验过这个默认做法靠不靠谱。这篇59页的论文第一次把它拉去做了受控实验:AI建的记忆库形状是模型的"性格签名";整理能省一半检索费,却换不来更好的答案;模型能力花在"读"上而不是"写"上;记忆越积越值钱,也越积越乱;换一套工具,就换一种记忆。读完你会重新理解"让AI记住东西"这件事。

第一章 桌子上的AI,为什么记不住你

上周你告诉AI助手:我在跟的项目是东南亚市场那份报告,客户只接受周五交付。这周你再问它进展,它客客气气地回你一句:能提供一些背景信息吗?

用AI干活的人,大概都吃过这个亏。单次对话里它聪明得像个资深同事,窗口一关,记忆清零。你上周的交代、上个月的偏好、半年前定下的规矩,对它来说统统不存在。你甚至开始怀疑,它上次答应得好好的那些事,到底有没有真的「记住」。

这种失忆不是产品做得敷衍,而是这类系统的先天结构决定的。要理解后面这篇论文为什么重要,得先把这个困境看清楚。

2026年7月,加州大学圣迭戈分校、默塞德分校、Adobe研究院和伊利诺伊大学厄巴纳-香槟分校的十一位研究者,把「AI怎么记事」当成一个正经的科学问题来研究。他们发表的论文(arXiv:2607.26637,59页,12张图,18张表)干了一件此前没人系统干过的事:第一次用受控实验,检验了当下AI智能体最主流的记忆方案,也就是把长期记忆存成一个markdown文件夹,让AI自己去读、去写、去整理。这篇论文的结论,一半让人安心,一半出人意料:AI的记忆确实会随着积累越来越有用,但它自己维护的记忆库,会随着增长悄悄变乱;而「把记忆整理得井井有条」这件事本身,几乎从来没能换来更好的答案。

这个结论为什么值得一个不写代码的人关心?因为你的AI助手、你同事的AI编程工具、市面上带「长期记忆」功能的智能体产品,背后用的几乎都是这套文件夹方案。它靠两个从未被检验过的假设撑着:第一,AI能让自己越积越多的记忆保持有序;第二,花时间整理记忆是有回报的。这篇论文把这两个假设摆上台面,逐一过堂。过堂的结果,会改变你对「让AI记住东西」这件事的看法。

为什么这两个假设值得较真?因为它们决定了钱往哪儿花。如果你的产品正在给AI做「记忆整理」功能,或者你自己每周花时间维护AI的记忆文件,这笔投入到底买到了什么,答案直接关系到该不该继续投。以前没人能说清,因为没人测过。

要理解它检验了什么,得先弄明白AI的记忆困境到底卡在哪。

办公桌就那么大

桌子上的材料越堆越多,档案柜负责长期保存

桌子上的材料越堆越多,档案柜负责长期保存

大语言模型智能体(LLM agent),指的是以大语言模型为大脑、能自己调用工具、观察结果、决定下一步动作的系统。你现在用的AI编程助手、能帮你订机票查酒店的AI助理,都算。它和单纯的聊天机器人的区别在于:它会动手做事,而不只是说话。

这类系统有个天生的生理限制,行话叫上下文窗口(context window),也就是模型一次干活时能同时看见的材料总量。你可以把它理解成一张办公桌:桌子有尺寸上限,现在的前沿模型换算成文字,从十几万到上百万字不等。听起来很大,但架不住活越干越多。一个陪你做几个月项目的AI,积累的对话、代码、文档,早就超过任何一张桌子。

更要命的是,这张桌子还有两个毛病。一是临时性:会话一结束,桌面清空,下次开工从零开始。你跟它说过的所有话,像写在沙盘上,风一吹就没了。二是越摆越乱:研究早就发现,桌子快满的时候,模型对材料的利用能力会先一步衰退。不是等塞满了才出问题,是没塞满就开始犯糊涂。材料堆得越多,它越容易漏掉关键信息、答非所问。

你一定见过这个毛病的日常版本:同一个对话里,你前面刚说过「别用表格」,聊了五十轮之后,它又开始给你发表格。不是它故意气你,是那条指令已经淹没在桌子角落的材料堆里了。

所以行业把希望寄托在「办公桌之外」:给AI配一个档案柜,把重要的东西存进去,需要的时候再取出来摆上桌面。这个档案柜,术语叫持久记忆(persistent memory),指跨会话、跨任务存活的存储,和随对话蒸发掉的上下文是两码事。桌子上的东西每天清空,档案柜里的东西长期保留。

注意,这里说的「记忆」是宽泛意义上的,心理学的老分类照样适用。一类是陈述性记忆(declarative memory):事实、事件、偏好、规矩这类能说出口的知识,比如「这个客户只接受周五交付」「老板不吃香菜」。另一类是程序性记忆(procedural memory):从经验里提炼出来的可复用操作,行业里一般叫技能(skills),比如「部署服务前先跑冒烟测试」「报销要先贴发票再填单」。前者像百科条目,后者像操作手册。这篇论文的一个设计野心,就是把这两种记忆放进同一个存储里统一研究,因为现实中,一个干活的AI既需要记住「客户是谁」,也需要记住「活儿怎么干」。

学术界造了一堆精巧的档案柜

给AI造记忆,学术界其实折腾了很多年,方案一个比一个精巧。

有仿照操作系统做「分页内存」的:上下文装不下的部分先挪到外部,用到时再调回来,像电脑用硬盘补内存。有专门抽取事实的:把对话里值得记的信息提炼成一条条存起来,类似给档案做索引卡。有建时序知识图谱的:谁在什么时候说了什么、状态怎么变的,画成带时间戳的关系网。还有做自链接笔记网络的、做摘要库的、用向量嵌入把记忆组织成树的。最后这种,就是把每条记忆转成一串数字坐标,意思相近的记忆在空间里离得近。

这些系统各有一套定制的存取接口,论文也各说各的好。但它们有个共同的尴尬:大多停留在研究原型阶段,真正被大规模部署到生产环境的,寥寥无几。它们像是实验室里的概念车,好看,但没人真开上路。

真正在现实世界里跑着的AI,用的是什么呢?答案朴素得让人意外:文件夹。

赢家是最朴素的那个

各类AI产品的记忆方案最终都收敛到文件夹

各类AI产品的记忆方案最终都收敛到文件夹

做AI编程工具的人最先想明白这件事。编码智能体本来就生活在文件里,读代码、改代码、跑脚本,全是文件操作。既然它已经精通文件,那让记忆也变成文件,就是零学习成本的自然延伸。不用教它一套新的记忆接口,它天生就会读写文件。

这个收敛过程没有谁拍板,是无数工程团队各自摸索后的殊途同归。你在A公司的智能体里看到的记忆方案,和B公司的长得几乎一样,不是他们互相抄,是文件这个介质本身的优点太强,把别的路都挤掉了。

于是行业实践收敛了。Anthropic的官方记忆工具,就是把记忆暴露成一个文件目录,配六个通用文件操作:查看、创建、字符串替换编辑、插入、删除、重命名。就这六招,没有更多。Claude Code会在本地维护一个索引化的记忆文件夹,存放智能体自己写的笔记。再往外看,整个生态都在往这个方向走:AGENTS.md这类上下文文件成了仓库标配,「技能」干脆以markdown文件的形式在生态里流通。你下载一个「技能」,本质上就是下载一个写着操作说明的文本文件。

文件夹能赢,理由很实在。它可检查:记忆是明文,人随时能打开看AI到底记了什么,发现记错了能直接改。它可携带:换个平台,拷走整个目录就行,记忆跟着你走。它用的还是智能体早就掌握的文件工具,不用额外学一套记忆专用接口。另外它天生分层:文件夹构成分类树,文件夹名就是标签,不需要额外的元数据系统。

这其实和人管理知识的本能一致。你回忆一下自己是怎么记东西的:重要的存进笔记软件,按项目分文件夹,起个看得懂的文件名。AI用文件夹,等于直接借用了人类几千年攒下来的档案管理直觉。

听起来很完美。但论文作者指出了一个被所有人跳过的事实:恰恰是这个被默认采用的方案,研究界几乎没正眼看过它。已有的工作要么在文件系统记忆之上造系统,要么研究「怎么在文件里检索」,唯独「记忆该建成什么样、长成什么形状、长大了还健康吗」这些关于形态本身的问题,没人系统回答过。

打个比方:全世界的建筑师都在用砖头盖房子,但从来没人认真测过,砖墙砌到多高会开始歪、怎么砌才不容易塌。大家只是默认砖头好用,然后一直用。

全世界的AI都在用文件夹记日记,但没人检查过这些日记本会不会越记越乱。

这正是这篇论文要补上的那一课。不过在请它出场之前,我们得先看清这个默认方案到底踩在什么假设上。那两条从未被检验的假设,才是整个故事的主角。

第二章 全世界都在用文件夹,没人研究过文件夹

文件夹方案在工业界的地盘,比多数人想象的更大。

先看产品层面。Claude Code,Anthropic的命令行编程智能体,给每个项目维护一个记忆目录,里面是智能体自己写下的笔记:项目的约定、踩过的坑、用户的偏好。你让它记住一件事,它不是把这句话塞进什么神秘的黑盒,而是老老实实写进一个markdown文件。你想知道它记了什么,打开那个文件就行。

再看API层面。Anthropic把「记忆工具」做成了官方能力,接口设计朴素到近乎直白:一个文件目录,加六个文件操作。没有向量数据库,没有专门的记忆查询语言,就是看、建、改、删、重命名,和你操作电脑文件夹没有任何区别。一家头部AI公司,把「记忆」这么听起来高深的东西,做成了文件管理器。

生态层面更夸张。「技能」这个概念,教智能体做某类任务的可复用说明,在主流平台上的载体就是一个包含markdown说明文件的文件夹。仓库级的上下文文件成了AI编程生态的事实标准,成百万的仓库在往里面写项目说明。也就是说,全球有海量AI的记忆,此刻正以纯文本文件的形式,躺在无数个硬盘上。

一个有趣的现象是,用户社区也在自发地做同样的事。在开发者论坛上,你能看到大量这样的分享:给AI配一个MEMORY.md记关键决策,配一个TASKS.md记当前任务,配一个日记目录存每天的进展。有人总结说:如果你有五到一百条需要记住的关键事实,纯文本文件就够了,它们可读、可调试、可版本管理。向量数据库?多数场景属于杀鸡用牛刀。

这个自发实践很能说明问题。连不懂底层原理的普通用户,摸索出来的答案也是「就用文本文件」。一种方案如果既被头部公司采用、又被普通用户自发复刻,那它就是事实标准,不管有没有人正式宣布过。

行业集体选择了文件夹,理由上一章说过:可检查、可携带、工具现成。但论文作者提醒,这个默认方案的地基里埋着两条从未被检验的假设。

假设一:AI能管住自己越积越多的记忆

写下一条记忆,再读出来,这是最简单的情况。麻烦在于时间拉长之后发生的事。

记忆会累积。累积带来四个麻烦:重复,同一件事在不同时间被记了好几遍;矛盾,新记的偏好和旧的冲突,AI不知道听谁的;过期,三个月前的事实今天已经不成立,但旧记录还躺在那儿;散落,同一个主题的信息散在七八个文件里,谁也说不清该去哪找。

这四个麻烦,人类的档案管理员天天在对付。区别在于,人类档案室有专人定期整理,而AI的记忆库,整理这件事要么没人干,要么交给AI自己干。交给AI自己干靠不靠谱,正是假设一要回答的。

所以存储不能只是「写入」,还必须被「演化」:更新、调和、重组。用人的经验类比:一个档案室如果只进不出、只堆不理,半年之后没人能在里面找到东西。AI的记忆库面临一模一样的熵增。乱,是默认趋势;不乱,需要持续的力气去维持。

更扎心的是,已有的补救手段都够不着这个问题的核心。学术界的记忆操作,增、删、改,作用在单条记忆上,从来不作用于存储的整体形状。就好比你只管往书架上塞书、抽书,却从来不重新规划书架的分区。工业界的补丁更有意思,它们有个共同的名字:做梦(dreaming)。

「做梦」补丁,恰恰暴露了问题

OpenAI的产品会在后台「做梦」:把历史对话合成一份扁平的记忆摘要。Anthropic则上线过一个叫Dreams的机制,从过往会话出发整体重建记忆库。名字很诗意,干的活很务实,趁AI不干活的时候,把它的记忆推倒重来一遍。

注意这两个机制的位置:都在智能体之外,都在后台运行。为什么需要外部力量定期来推倒重建?Anthropic自己的说法很诚实:因为工作智能体自己的写入是「局部且增量」的,存储会在两次重建之间慢慢退化。

这句话值得咂摸。行业头部玩家已经用实际行动承认:正在干活的AI,管不好自己记忆库的长期健康,所以得趁它「睡觉」时找人把档案室重新整理一遍。这等于说,我们默认AI自己记东西会记乱,只能定期请保洁来大扫除。

但外部清理治的是标。它回答了「乱了怎么办」,没回答「AI自己能不能不乱」。真正的问题是:AI自己到底能不能让一个不断长大的记忆库保持有序?整理这件事花的钱,能不能赚回来?这两个问题在论文出现之前,答案的状态不是「是」或「否」,而是「没人测过」。

顺带说一句成本。用模型去改写记忆库,每一次整理都要消耗token,都是真金白银。如果整理完了记忆反而更差,那这笔钱就是纯亏损。之前有研究指出,让模型持续改写记忆库,效果甚至可能掉到「没有记忆」的水平以下。所以「该不该整理」不只是哲学问题,是账本问题。这篇论文第一次把账本翻开了。

假设二:整理是有回报的

第二条假设藏得更深。

它默认了一个因果链:记忆组织得越好,AI用起记忆来越顺手,答案质量就越高。听起来天经地义,人类的档案室不也是这样吗?分类清晰的档案馆,查资料就是快;乱糟糟的档案馆,找份文件要半天。

但论文作者提出了反方向的可能:也许一个平铺直叙、毫无结构的存储,配上足够强的检索工具,效果完全一样好。那样的话,所有花在整理上的工夫就是一场昂贵的绕路,你在给一个根本不需要书架的房间打书架。

为什么这个反方向的可能成立?因为检索技术在进步。如果有一个足够聪明的检索工具,能在一大堆散乱文件里精准定位你要的内容,那么文件摆放得整不整齐,可能根本无所谓。就像你家再乱,只要你有个记忆力超群的管家,你要什么他都能立刻翻出来。

再往深想一层:整理是有成本的。每一次重组、合并、归类,都要消耗模型的调用和token。如果整理带来的只有「检索变快」,而检索工具本身已经够快,那整理这笔投资就悬了。它到底买来了什么,得拿数字说话。这正是论文要测的第二条假设。

这两种可能,直觉上都说得通。组织也许是让记忆可持续的关键,让它长大之后依然好搜、可信;也许组织只是自我感动。在没有实验数据之前,它们谁也说服不了谁。而这正是整篇论文最值得看的地方:它没有站在任何一边,而是把两边都拉去测了一遍。

到这里,故事的悬念已经搭好:一个被全世界默认采用的方案,站在两条没人验证过的假设上。接下来登场的论文,做的事情就是设计一套足够干净的实验,把这两条假设逐条过堂。

实验怎么设计,才能把「记忆形态」这个混沌的东西拆成可控的变量?论文给出的答案,是一个干净的比喻:一间档案室,三种角色。

第三章 一个档案室,三种角色:论文怎么设计实验

要把「文件夹记忆好不好」这种模糊的问题变成可测量的实验,得先把它拆成能单独拨动的旋钮。论文的做法,是把整个系统抽象成一句话:一个记忆存储,加上围着它转的三个角色。

这个抽象本身就值得夸一句。研究记忆系统的论文,多数会顺便造一个新系统,然后在自家系统上自夸。这篇反着来:它不造新系统,而是把已经在跑的系统抽象成角色和契约,让实验结论能直接映射回真实产品。

三个角色,各管一段

档案室三角色:管理员、前台、一线员工

档案室三角色:管理员、前台、一线员工

想象一间公司档案室。

管理智能体(management agent)是档案管理员。新材料进来,可能是一段对话、一次任务记录,由它决定怎么入库:写进哪个文件、要不要新建目录、旧的记录要不要合并或改写、过时的内容要不要删除。它的权力很大:整个存储里任何东西,它都可以创建、重写、合并、拆分、移动或删掉。组织不是它的副产品,而是它的本职。

检索智能体(search agent)是档案室前台。有人来问问题,它去存储里翻查,然后带着出处回答。关键约束是只读:它回答所依据的存储,必须是它查询时的那个存储,不许一边查一边顺手改档案。它的每个答案都要带引用,具体到文件路径和行号,让答案可以被核查。这个带出处的能力,术语叫归因(attribution),它保证每个回答都能追溯到存储里的原始记录,而不是模型的自由发挥。

执行智能体(execution agent)是一线干活的人。在「技能」场景里才出场:它拿到检索来的技能文件,照着去执行任务,产出操作轨迹和成败结果。它是把「存储质量」翻译成「任务成绩」的那根探针,手册写得好不好,看干活结果。

三个角色之间怎么衔接?执行智能体干活时经历的内容,会作为内容块(chunk),就是内容流被切成的进料单元,流向管理智能体;需要记忆时,再由检索智能体把相关内容取回来。在一套编码智能体里,这三个角色完全可以是同一个模型分饰三角,契约设计得足够小,就是为了能直接映射到真实部署的系统上,而不是再造一个实验室玩具。

为什么要分三个角色?因为「写记忆」和「读记忆」是两种不同的本事,混在一起就没法判断问题出在哪一端。把角色拆开,实验才能分别拨动两端的旋钮。这是整篇论文实验设计的骨架。

工具箱也是实验对象

角色不能直接用手碰档案,只能通过一套工具操作存储。这套工具集合,行话叫工具挂具(tool harness),你可以理解成发给管理员的工具箱。

论文试了三种工具箱。一种是沙箱化的命令行shell,等于给了全套文件操作能力。一种是仿照工业界记忆工具的六个文件操作(查看、创建、字符串替换、插入、删除、重命名),外加按行的正则搜索。还有一种在前者基础上加了排序关键词检索,用的是BM25,一种经典的检索算法,按词的频率和稀有度给文档打分,像图书馆的老式索引卡片,关键词越稀罕、出现越多,卡片排得越靠前。这里顺带交代另一个词:检索增强生成(Retrieval-Augmented Generation,RAG),就是先从外部存储检索相关片段、再喂给模型生成答案的做法,相当于开卷考试。

工具箱为什么重要?论文的一个核心发现后面会讲:换一套工具,AI建出的记忆库形状会彻底改变。工具不是中性的包装,它本身就是塑造记忆的手。这是后话,先记住工具箱是个可以单独拨动的旋钮。

什么叫「整理得好」:五条规矩

「记忆库组织得好」不能靠感觉评判。论文给管理智能体的指令里写了五条原则,作为「好书架」的验收标准,合称分类法契约(taxonomy contract):

其一,同级可区分,同一个目录下的东西,光看名字(最多再看一眼一行描述)就能分清谁是谁,不用打开内容。其二,同级相关,放在同一个目录下的,得确实是一家人。其三,父覆盖子,目录名要罩得住里面的所有内容,进了一个目录就等于缩小了搜索范围而不会漏东西。其四,距离反映相关,内容越相关,在树里住得越近。其五,结构为检索服务,加层级只在能帮人更快找到东西时才加,纯粹为了好看而加的一层属于浪费。

这五条在整棵树的所有层级生效,包括文件内部的标题层级。后面章节出现的「分类法遵从度」指标,量的就是存储对这套契约的遵守程度。

这套契约的价值在于把「整齐」变成了可计算的东西。没有它,「这个记忆库乱不乱」就是个主观感受;有了它,可以逐项打分。论文后面那些「组织在侵蚀」的结论,全靠这把尺子量出来。

从「不记」到「全自主」:六种记忆形态

六种记忆形态谱系:组织的剂量从零到最大

六种记忆形态谱系:组织的剂量从零到最大

实验要对比的不止「整理vs不整理」,而是整条谱系。论文设计了六种记忆变体,从完全不记到AI全自主策展:

闭卷(Closed-book):不建任何存储,纯靠模型自己的知识硬答。这是地板,量出没有记忆时模型有多无能。

块检索(Chunk retrieval):把内容流原样切成块,每块一个文件,建个关键词索引。这是前面说的检索增强生成的标准对照组。

逐字转储(verbatim dump):把对话按场次原样存成文件,一个字不改,文件描述只写场次号。零模型成本,是「零策展」的基线。

分目录会话(foldered sessions):让AI只设计文件夹分类,然后把逐字稿原样挪进对应文件夹,只移动,不改动一个字。这样,分类结构是唯一被加进去的东西。

重组存储(reorganized store):让AI打散逐字稿,跨场次拆分合并,按自己的判断重新分组。这个变体做了两个版本:默认版和加了一条「保留所有事实」规则的保护版。为什么要分两个版本?因为研究者发现AI在自由重组时会偷偷删内容,这个发现本身就是一个实验结果。

智能体策展存储(agent-curated store):从空目录开始,管理智能体跟着内容流一路自主决定写什么、怎么组织。这是离真实产品最近的形态。

六种形态排开,「组织」这件事的剂量就从零一路加到最大。这种谱系设计的妙处在于:任何两个相邻变体之间只多了一样东西,于是差异可以归因。闭卷到块检索,多了检索;块检索到逐字转储,多了文件形态;逐字转储到分目录,多了分类;分目录到重组,多了内容改写;重组到策展,多了持续维护。每一步加的料是什么、带来什么变化,一清二楚。

四块试金石

记忆形态有了,还得有考题。论文选了四个基准,覆盖两类场景。

对话记忆这一侧有三个。LoCoMo是这个领域的默认长记忆考题:多场次长对话配上158道考题,考多跳推理、时间推理、开放域和单跳四种本事。PersonaMem考「人设记忆」:一段人设信息密集的长流,中途插入选择题,看AI还记不记得这个人是谁、喜欢什么,分32k和128k两个长度档位。REALTALK最特别,用的是21天真实的人类聊天记录配85道题,不是合成的规整对话,是真人之间带语气、带跑题的自然聊天,检验结论在野生语料上站不站得住。

技能那一侧是ALFWorld,一个文字版具身环境,相当于文字冒险版的《模拟人生》:140个家务任务,分六个目标家族(放东西、找东西、清洁、加热、冷却、混合),AI要在虚拟屋子里完成「把苹果加热后放到桌上」这类活。环境自己报告成败,不需要裁判模型。

技能场景还有个防泄漏的设计值得一提:第i个任务只能检索前i-1个任务攒下的存储,绝不允许拿后面的经验答前面的题。如果不做这个隔离,成绩里就分不清是「记忆真有用」还是「提前看了答案」。这种细节不起眼,但它决定了一个学习实验的结论能不能信。

为什么一边用对话、一边用家务任务?因为两种记忆要在同一个框架下各考一次:对话考的是「记得住事实吗」(陈述性记忆),家务考的是「学到的经验能用上吗」(程序性记忆)。一套结论如果只在其中一边成立,分量就要打折。

裁判这一环也做了严格处理:对话类答案用同一个判断模型(judge model,就是用一个冻结配置的大模型当阅卷老师)评分,配置在实验开跑前就在校验集上校准并锁死,全程不许换人换标准。阅卷老师中途换人,分数就没法比了。

实验的纪律

论文在方法上最让人服气的一点,是它的对照纪律:每个研究只动一个变量,其余全部冻结。研究模型能力,就只换管理智能体的模型;研究工具,就只换工具箱;研究规模,就只换内容流的长度。

它还坚持量「增长曲线」而不只是「终点成绩」:技能场景的完整链条协议,会把140个任务一路跑下来,每个任务之后给存储拍一张快照,这样就能看见记忆库是怎么一步步长大的,而不只是看它最后长成了什么样。

装置搭完了。论文随后抛出五个研究问题:AI自己会建出什么形状的存储?形状值不值?模型能力花在哪?存储长大了会怎样?工具动了会发生什么?

下一章开始过堂。先说第一个发现,它和所有人的直觉都不一样。

第四章 AI建的记忆库,是它的性格,不是任务的形状

第一个研究问题最直观:让管理智能体放开手脚自己组织,它到底会建出什么样的记忆库?

答案的第一层:四个基准上,同一个管理智能体建的库全都按主题分类,这一点不意外。你让AI整理记忆,它和你一样,第一反应都是按主题归堆。但答案的第二层,就开始反常识了。

同一种材料,三种长相

同样的素材,不同模型建出三种形状

同样的素材,不同模型建出三种形状

先看同一个管理智能体在不同材料上建出的库,形状差异大到像不同物种。

LoCoMo的库把几乎所有层级塞进了文件内部:总共3个文件(每个说话人一个,外加一个共享线索),文件内部用116个标题把树撑到五层深,文件之间靠151条「另见某某文件」的交叉引用互相勾连。也就是说,它把整本档案写进了三本大册子里,靠目录页和脚注互相指路。REALTALK正好反过来,层级全在文件那一层:41个主题文件装在两个文件夹里,文件内部倒是扁平,平均只有两节,它选择了多开抽屉、每个抽屉少放点。PersonaMem 32k长成一个温和的树:约3个文件夹装12个文件。而PersonaMem 128k把LoCoMo的路数推到极端:2个文件,内部210个标题嵌套到六层,平均每层分叉11路。

同一个管理员,四种材料,四种树形。这说明存储的形状不是材料单方面决定的。那它到底由什么决定?论文用两个干净的对照把「模型」和「规模」拆开。这种拆变量的手法值得说一句:现实里材料、规模、模型永远混在一起变,想归因,就得每次只动一个。

规模变大,AI不是分片,而是整合

第一个对照:固定管理智能体不动,把PersonaMem的内容流从32k拉长到128k,材料量大约变成五倍。

直觉预测:材料多了五倍,文件应该变多、目录应该分裂。就像书多了自然要多买几个书架。实际发生的事正相反:文件夹和文件这两层变薄了(约3个文件夹×12个文件,收缩成1个文件夹×2个文件),而文件内部的标题层翻了四倍(53个标题涨到210个)。

存储没有随规模分片,它在整合,层级从文件夹和文件搬家到了标题里。材料涨五倍,AI的应对不是多开抽屉,而是把抽屉里的目录页做得更厚。

这个发现很关键,因为它说明「文件数」根本不是衡量组织程度的尺子。那个看起来简陋的「2文件」库,其实是深度6、平均扇出11的树,比大多数多文件库都深邃。以后你再看到某个AI的记忆目录里只有两三个文件,别急着嘲笑它懒,翻开看看里面有多少层标题再说。

换个模型,同一份材料变成完全不同的库

第二个对照更狠:固定128k的材料不动,只换管理智能体的模型。同一段对话,三个模型建出三个世界:

弱模型(gpt-5.4-nano)建了122个文件、12个文件夹,一棵浅森林,没有叶子超过五层。中档模型(gpt-5.4-mini)建成2个文件、210个标题,几乎把所有结构都收进文件内部。最强模型(gpt-5.4)建了105个文件、4个文件夹、七层深,还用233条交叉引用把105个文件缝成一张网,是中档模型引用数的三十倍。

文件数在122、2、105之间摆了一个数量级。材料一个字没变,变的是干活的那个大脑。三个模型面对同一堆素材,一个像爱开抽屉的收纳师,一个像写大册子的史官,一个像织网的蜘蛛。

所以结论很明确:存储的形状首先是管理智能体的行为签名,而不是对规模的响应。想知道这段记忆是谁建的,看看树形就够了,这几乎是指纹。论文也提醒,跨基准比较形状时,还得小心混进内容类型的干扰,对话材料和人设材料的结构需求本来就不同。

最瘆人的发现:AI整理记忆时,默认会偷删东西

AI整理记忆时,内容从指缝间无声滑落

AI整理记忆时,内容从指缝间无声滑落

受控变体那边还挖出一个谁都没料到的行为。

重组存储这个变体,让AI把逐字稿打散重组成主题文件,暴露了论文观察到的最清晰的退化行为:研究者只要求它「重构」,没提任何压缩要求,它却在重写过程中悄悄删掉了记录的细节。存储明显缩水了,内容无声蒸发。没有人下令删,它就是删了。

为什么?论文的解释是:重写这个动作天然带压缩倾向。模型在重新表述一段内容时,会不自觉地「提炼」,而提炼的副产品就是丢细节。它以为自己在整理,实际上在销毁。

直到加上一条明确的「保留所有事实」规则,内容才大致守得住。论文为此专门做了两个版本来量化这个倾向:默认版(放任压缩)和保护版(强制保留)。注意,默认版的删减不是任何指令要求的,那是模型在自由重组时的自发行为。

这个发现对任何正在使用AI记忆产品的人都有直接含义:当你的AI助手「整理」自己的记忆文件时,它很可能正在扔掉你以为还在的东西。那些「以后可能用得上」的细节,恰恰是整理动作最容易牺牲的。

技能场景:能力直接写在文件数上

技能那边,管理智能体的组织行为是另一套逻辑。同样跑完140个任务的完整链条:弱模型铺开114个文件,大多是扁平的,配几个主题文件夹;中档模型整合成45个;最强模型蒸馏成16个致密条目。对照物是机械的回合日志,140个任务140个文件,一个不少。

和对话场景不同的是,技能存储的层级在所有层都一致地收缩:最强模型的16个文件只带43个标题,而对话场景中档模型2个文件就塞了210个标题。技能树也一律浅,没有任何一个管理智能体建出超过四层的树。在这里,能力表现为文件的粒度,而不是深度。模型越强,写出来的条目越浓缩,就像越有经验的师傅,写操作手册越薄。

两种条目的配比也随能力变化:最强模型的库里只有5个技能文件(每个目标家族一个),却被11条警告笔记超过;弱模型的114个文件则是技能占大头,89个技能配25条笔记。弱模型爱记「怎么做」,强模型爱记「别踩什么坑」。这个差异很耐人寻味:知道哪里会出事,比知道常规步骤更值钱。

小结:形状是签名,不是答案

把第一个研究问题的答案收拢:让AI自由组织,它总会按主题建树,但树的具体形状,层级住在哪里、文件碎还是整、引用多还是少,首先是模型的脾气,其次才是材料的形状。规模增大带来的是整合而非分片;而放任AI重组记忆,要当心它顺手删东西。

这里还藏着一个方法论上的提醒:以后看到任何「我们的记忆系统设计得很好」的宣传,先别急着信,问一句「这个形状是设计出来的,还是模型自己长出来的」。这篇论文证明了,形状很大程度上是模型性格的投影,跟设计意图关系没那么大。

形状千奇百怪,这本身不是坏事。真正要紧的问题是下一个:这些形状,到底有没有用?哪一种能让AI答得更好?

答案比所有人预想的都要扫兴,而且扫兴的方式很有讲究。

第五章 整理省一半的钱,买不来更好的答案

第二个研究问题是整篇论文的心脏:记忆库的形状,到底改变AI的答案吗?代价又是什么?

这个问题之所以是心脏,因为它直接检验那条最朴素的信念,「整理有用」。如果答案是肯定的,那么全世界花在记忆整理上的工夫就物有所值;如果答案是否定的,那我们就得重新想想,钱该往哪儿花。论文用两组场景把这个问题拆开:对话记忆和技能。

先说让人安心的部分。闭卷对照(不建任何存储,纯靠模型自己的知识硬答)在所有存储面前全面落败,而且在对话类基准上输得极其难看:LoCoMo上闭卷只答对18.4%,有存储的变体都在80%上下;REALTALK上闭卷10.6%,有存储的77%左右。PersonaMem两个档位上闭卷靠选择题蒙题稍微体面些(34.4%和47.6%),但依然垫底。结论简单粗暴:这些题考的是存储里的对话,不是模型脑子里的常识,记忆不是锦上添花,是生死线。

这组数字给「要不要记忆」画上了句号:要。没有记忆的AI,面对需要长期信息的任务基本是瞎子。真正的争论不在这里,而在「记忆该做成什么样」。

引用的质量也全线达标:无论存储形状如何,答案的归因支持度都在82%到98%之间。任何文件系统存储都能提供可核查的出处。这一点很重要,因为它意味着「能不能找到依据」不是瓶颈,「能不能答对」才是。

但接下来,就是扫兴的部分了。

正确性没有常胜将军

六种记忆形态×四个基准:没有常胜将军

六种记忆形态×四个基准:没有常胜将军

「组织越好的存储,答案越好」,这个直觉预测被数据直接推翻。

最反直觉的对比在这里:最便宜的结构化存储「分目录会话」(只加了个文件夹分类,内容一字未动),反而是最稳定的领先者,LoCoMo上86.1、REALTALK上77.6、PersonaMem 128k上76.2,它都并列或独占第一。一个几乎没花力气整理的方案,笑到了最后。

而最精心策展的「智能体策展存储」呢?它只在LoCoMo上领先(86.1),在PersonaMem 32k上却是所有存储里最差的:37.5%,连逐字转储的78.1%都够不着,甚至不如最基础的块检索(71.9%)。一个AI从空目录开始、一路自主决定写什么怎么组织的库,输给了一个「文件挪进文件夹、内容原封不动」的廉价方案。

这个落差值得停下来想一想。策展存储是论文里最接近真实产品的形态,AI全程自主决定记忆怎么写、怎么摆。可恰恰是它,在某个基准上垫了底。原因论文后面会给出线索:策展存储把内容按自己的理解重新表述,而重新表述可能丢失了答题需要的原始细节。换句话说,AI用自己的话复述一遍,反而把关键的字眼复述没了。

逐字转储在32k档位直接领先,块检索在对话类基准上则几乎垫底(只赢过一个变体)。六种形态,没有一个在任何地方全面占优。

论文特意提醒读者别对小幅差距过度解读:各档位的题目数从32道到158道不等,让判断模型重复评同一个格子,结果会漂大约两道题(±1.3分)。小档位上几个百分点的差距,是「暗示」而不是「定论」。这种自我克制的表述,反倒让大差距的结论更可信。

组织唯一稳赚的:检索成本

大材料上,整理省一半以上检索成本

大材料上,整理省一半以上检索成本

如果组织不能买来更好的答案,那它买来的是什么?

答案清晰得可以开发票:检索经济性。而且材料越大,赚得越多。

看数字。PersonaMem两个档位是最大最密的材料(逐字转储分别137KB和612KB),在这两个档位上,重组和策展存储把逐字转储的每查询检索成本砍掉一半还多:32k档位1.4美分对4.0美分,128k档位1.6美分对3.9美分。而在较小的对话类基准上(材料只有102-105KB),各家存储的检索成本和逐字转储基本打平,2.1到2.5美分之间。

翻译一下:材料小的时候,整不整理,查起来花的钱差不多;材料大的时候,整理过的库查起来便宜一半以上。这符合直觉,房间小的时候,东西乱扔也能快速找到;房间大到一定程度,不分区就会找死人。

机制也摆在台面上:在大材料上,重组和策展存储的检索其实花了更多轮次和工具调用(七八次对四五次),因为检索智能体在「按结构导航」而不是「全文扫描」。但每次定向读取拉回来的token少得多,总账在逐字转储变大的地方掉头向下。多走了几步路,但每步都走得准,总消耗反而降了。

一句话总结:结构买来的是搜索经济性,在最需要它的材料上买得最多。注意,买的是「搜索经济性」,不是「答案质量」,这两者的区别,是整篇论文最重要的一个分野。

两种重组,一正一负

「保留所有事实」和「放任压缩」两个重组版本的分歧,也值得单独说。

在对话类流和长的128k档位上,保留版明显更好:LoCoMo上82.9对79.1,128k上59.5对54.8,REALTALK上最惨烈,77.6对41.2,放任压缩直接把正确率砍掉近一半。这些场景里,删掉的细节就是答不出来的题。

但到了PersonaMem 32k,符号翻转:压缩版68.8,保留版56.2。更紧凑的库更好搜,压缩反而成了优势。

同一个重组器,换个基准,收益方向就翻转。这是「不存在放之四海皆准的压缩策略」最清晰的证据。要不要删细节,取决于你的任务是靠细节吃饭,还是靠快速定位吃饭。一刀切的「保留所有」或「尽量精简」,都会在某个场景里吃亏。

技能场景:赢家取决于谁来读

强弱执行智能体下的赢家翻转

强弱执行智能体下的赢家翻转

技能场景把问题推向更深处:记忆的价值不只取决于材料,还取决于消费它的人。

实验里,同一个技能库由两档执行智能体来用:强档(gpt-4.1)和弱档(gpt-4.1-mini)。结果出现了一个干脆的翻转:

强执行智能体手下,原始回合日志(episode log)领先,87.1%的成功率,完整轨迹原样喂给它,它自己消化。蒸馏好的指导(指导合成,guidance synthesis,简称GS,检索智能体读完存储后为当前任务现写一段针对性建议)以82.1%屈居第二。

弱执行智能体手下,顺序完全倒转:GS指导以76.4%领先,回合日志只有66.4%,差10个百分点。统计检验给了弱档的翻转更硬的支持(符号检验p≈0.02),强档的差距则在噪声边缘。

为什么会翻转?论文把机制挖了出来:把执行智能体从强档降到弱档,回合日志的成绩掉了21分,GS只掉6分。执行智能体的无效动作率(操作失败的比例),在回合日志下从19%涨到36%,在GS下只从12%涨到22%。

翻译成人话:原始的完整工作记录,需要一个足够强的脑子才消化得动;而把经验提炼成针对当前任务的建议,弱一点的脑子也能接得住。好比你给新员工培训:扔给他三年的原始会议记录,不如给他一页「这个活注意这三点」。强员工能自己从记录里挖宝,弱员工只会淹死在记录里。

两个推论,都关乎真金白银

翻转之后跟着两条推论。

第一条:记忆对弱执行智能体更值钱。相对无存储的地板,弱档拿到的提升是23.5个百分点,强档只有13.5个百分点,恰恰在部署成本最低的地方,记忆的回报最高。这有点反常识:我们总以为好记忆是给聪明的AI锦上添花,数据说,好记忆更是给普通AI雪中送炭。

第二条:GS指导还是部署成本最低的存储。它的紧凑存储让检索便宜,它的指导让任务回合变短。按「每解决一个任务」算钱,GS甚至低于不建存储的方案(5.7美分对6.1美分),记忆在部署环节自己把账单付了。真正的额外开销在建造环节:GS每140个任务要付10到11美元的策展费,回合日志是零。

这又是策展与搜索之间那笔老账。对话场景说:组织值不值,看材料大小;技能场景说:组织值不值,看谁来消费。两个半边的答案,都拒绝给出无条件的赢家。「整理有用」这个朴素信念,被拆成了两半:省钱的整理有用,提质的整理,没找到。

而最扎心的那个结论,要留到下一章,关于模型能力到底花在哪儿。

第六章 更强的模型,建更漂亮的档案室,仅此而已

第三个研究问题问的是能力:记忆管理得好不好,跟模型本身的强弱挂钩吗?

这个问题在行业里有个流行的默认答案:模型越强,干什么都越好。所以很多人搭记忆系统时的思路是,把最强的模型用在所有环节上。论文把这个假设拆成两半各做了一组对照实验:把「写记忆」和「读记忆」分开,看模型能力分别在哪里兑现。结果拼在一起,是整篇研究里最干净的一个事实。

写记忆:能力买的是风格

写记忆能力买风格,读记忆能力买成绩

写记忆能力买风格,读记忆能力买成绩

PersonaMem 128k的那段对话,用三个不同档次的模型分别当管理智能体来建库,检索智能体固定用中档模型。这样设计的原因很简单:如果三个库最后答得一样好,那说明写记忆这端,模型强弱不重要。

三个库在结构上毫无共同之处:弱模型铺开122个文件、12个文件夹;中档模型整合成2个文件、210个标题;最强模型分成105个文件、七层深、233条交叉引用。上一讲过,这是能力的签名。

但正确率呢?73.8、66.7、71.4,一个七个百分点的区间,而且不随模型强度单调变化。最强的没赢,最弱的也没输。这个区间是什么概念?同一段对话重复评判,本身就会漂一两道题(约1.3±1.3分)。换句话说,三个模型的答案差距落在统计噪声里。

固定的检索智能体,把一个数量级的存储形状差异,吸收成了零答案差异。122个文件的散乱库和105个文件的精致网,在会读的人手里,效果一样。

干活量也在说同样的故事:最强模型干活最卖力(3921次工具调用,是中档1986次的两倍),建出的库检索起来还最贵(每查询3.8美分对2.6美分),但它没有比最弱的模型答得更好。花了两倍的力气,建了最贵的库,换来打平的成绩。

在这段对话上,更强的管理智能体买到的是更精致的存储,不是更有用的存储。前提是检索智能体固定、指令写清了结构为什么服务。

读记忆:能力一分一分地兑现

检索那一侧的对照,答案完全相反。

同样的三个固定存储,换三个不同档次的检索智能体来读。平均正确率从弱档的约62,到中档的71,到强档的79,单调上升。没有例外,没有平台期,一分能力一分成绩。

读,而不是写,才是这个基准上模型能力真正兑现的地方。这个不对称值得反复琢磨:同样是模型升级,升级检索端立刻见分,升级管理端只见风格。

而且强检索智能体救不了精致的库:最强模型读弱模型建的散乱库读得最好(83.3%),读那个最精致的105文件+233指针的库反而最差(71.4%)。无论换哪个检索智能体,那座精心缝制的大库都没能换来回报。精心不等于好用,有时候精心只是复杂。

成本列也交代了能力的价码:检索智能体的强弱,而不是存储的形状,是成本的主轴。一个查询,弱档不到1美分,中档2到4美分,强档10到19美分。而在同一个检索智能体内部,换存储最多改变两倍账单。那两倍里还藏着组织的价值:整合的两文件库,把强检索智能体的每查询账单从18.5美分砍到10.0美分,正确率几乎不动(81.0对83.3),组织再次用搜索经济性兑现自己。

边界:能力在「写砸了」的地方才有用

这个不对称有它的边界,论文把边界也量了出来。

在32k档位的某些对话上,策展存储因为建造时的缺陷(比如把用户改变的偏好记成带日期的更新,却留着旧事实装作依然有效)直接崩了。这时候,同一个管理智能体的升级就能挪动结果:固定检索智能体的成绩从12题涨到18题(32题里)。

所以准确的表述是:存储本来就能服务好检索智能体的地方,管理能力的强弱没人看得见;建造本身是失败环节的地方,管理能力才显形。能力不是处处兑现,而是在短板处兑现。这对工程预算的含义很实在:先查建造环节有没有出缺陷,有的话升级模型能救;没有的话,钱花在检索端。

技能场景:能力是一道门槛

技能那边,能力的作用方式又不一样,不是平的,也不是单调的,是阈值。

固定执行和检索智能体,只换管理智能体的模型:弱档和中档打平(75.0%对76.4%,统计上完全无差异,p≈0.85),而弱档的策展成本只有中档的七分之一(1.59美元对10.82美元)。最强模型则跳档:+13个百分点到89.3%(p≈0.001),涨分集中在真正需要程序迁移的两个任务家族。

也就是说,蒸馏这件事有个及格线。及格线以下,便宜的弱模型和贵的中档模型效果一样(那就用便宜的);过了及格线,收益跳出来。中间那段钱,属于白花。

存储能解释这个跳档:弱模型建114个零碎文件,中档整合到45个,最强模型蒸馏成16个致密、自包含的条目,在链条走完四分之一时就停止生长,之后只做编辑合并。所有模型都守住了格式规范,所以能力买到的不是格式合规,是蒸馏质量。一个细节很有说服力:弱模型老老实实归档了12条加热相关条目,加热任务只拿了6%;最强模型只用了两条致密的加热条目,拿到75%。条目不在多,在透。

压轴发现在这里:最强管理智能体建的库,配上弱档执行智能体跑完整链条,得分超过了所有用强档执行智能体的组合,包括回合日志的88.6%。在这条链上,策展了什么,比谁执行更重要。好手册配普通员工,赢过差手册配精英员工。

小结:能力花在刀刃上,刀刃是「读」和「蒸馏」

两个场景拼出完整的图景:写记忆如果是记录和整理已有内容(对话场景),能力买来的是风格,不是质量;如果写意味着把嘈杂的轨迹提炼成可迁移的程序(技能场景),能力以阈值的方式起作用,过了门槛,买到的也不是结构,是蒸馏质量。

读记忆则全程单调:检索能力一分一分兑现成分数。

这组不对称给所有在搭建AI记忆系统的人一个直接的忠告:预算有限时,把钱花在会读记忆的那一方,而不是会写的那一方。升级检索模型,成绩立涨;升级管理模型,只换来一座更漂亮但没人读得更好的档案室。

这个忠告之所以反直觉,是因为大多数人搭系统时本能地重「写」轻「读」。写记忆看得见摸得着,库建得漂不漂亮一眼能瞧出来;读记忆是个黑盒,效果好坏藏在答案里不好归因。于是预算都花在了能看见的地方。论文用数据把这个错觉戳破了:你看得见的那部分,恰恰不是决定成绩的部分。

还剩一个问题悬着:记忆越积越多,到底会越好还是越乱?下一章,让数据说话。

第七章 记忆越积越值钱,也越积越乱

第四个研究问题是「可持续性」:一个不断长大的记忆库,还能保持有用吗?每次使用还便宜吗?后来的写入会不会把早先的记忆弄坏?

这三个问题对应三种担心:怕记忆白积(越积越没用)、怕越用越贵(账单失控)、怕后浪拍死前浪(新内容覆盖旧内容)。它们决定了一件事:这套文件夹记忆的方案,到底能不能陪你走长线。论文用技能场景的完整链条协议(140个任务一路跑下来,存储每任务拍一次快照)给出了最直接的观测。三个问题,一个有好消息,一个有账单,一个有警讯。

好消息:存储越大越有用

在测过的每个模型、每种存储下,成绩从链条头到链条尾一路上升,140个任务之内没有任何退化。记忆不是越积越拖累,而是越积越趁手。

先给这个结论定个性:它是在「每个任务都只能检索之前攒下的存储」的严格条件下测出来的,不是事后诸葛亮。也就是说,成绩的提升确实来自积累本身,而不是任务越往后越简单(任务顺序是固定的,难度漂移被对照设计抵消了)。这个前提成立,后面的复利故事才站得住。

复利效应最陡的地方,恰恰在执行智能体最弱的地方。弱档的回合日志,前35个任务只有51.4%的成功率,和不用记忆的地板差不多;跑到最后35个任务,91.4%,比强档模型跑短链的平均成绩还高。一路上它的无效动作率从40%降到24%。一开始它跟无记忆的笨蛋没区别,跑到后面它比没记忆的聪明模型还强。

这句话值得记住:积累的经验,可以替代执行智能体的能力。弱模型+长期积累的记忆,能追平甚至超过强模型+干净起步。对预算敏感的场景,这是整篇论文最值钱的一条结论,你买不起最强的模型,但你可以让一个普通模型攒够经验。

回合日志还有个特点:它是原始记录,越积越多,后边的任务还在持续从中榨出价值。两条链协议(140任务长链)对三短链协议,回合日志在强档多拿1.4分,在弱档多拿7.1分(66.4涨到73.6),原始回合库恰恰为那个最不善于从每次经验里提取东西的执行智能体持续付费。强模型自己会总结经验,弱模型需要原始素材反复翻检。

账单:两种存储,两种老化方式

存储增长曲线:线性膨胀vs早早收敛

存储增长曲线:线性膨胀vs早早收敛

存储长大的代价,按形态分开算。

策展存储会「成熟」:最强管理智能体的库在链条走完四分之一时就基本停止生长(最终16个文件里14个在第35个任务前就存在了),之后只做编辑和合并。GS指导的每任务检索成本全程是全场最便宜的。这类库像一本越写越精的手册,页数不怎么涨,内容越来越实。

回合日志则无界生长:跑到链条尽头,弱档下已经积累140个文件、270KB,它的每任务检索价格随着存储一起爬升,始终数倍于GS那条平线,按整条链算账,7.88美元对2.97美元。「全量服务式检索」(每次都把整个库端上来)的负债,跟着存储本身一起膨胀。这类库像流水账,越记越厚,翻起来越来越贵。

把这两条曲线画在一张图上,就是「剪刀口」:开局时日志的检索成本和策展差不多,随着任务推进,日志的成本线一路向上,策展的成本线基本走平。跑得越久,剪刀口张得越大。短期看不出差别的两种方案,长期账单能差出两三倍。

选哪种存储,等于选哪种老化曲线:一种是前期付策展费、后期成本平坦;一种是前期零成本、后期账单滚雪球。跑短任务用日志划算,跑长线必须策展。

对话那边的增长曲线也有意思:LoCoMo和PersonaMem 128k的库,文件数从第一批内容进来就定死在两三个,之后全是编辑,章节标题线性生长,创建动作立刻归零(LoCoMo全程3次创建、226次编辑)。对话式建造从一开始就是编辑主导的,和技能场景先铺文件再收敛的节奏完全不同。对话记忆像养一个活文档,技能记忆像先攒素材再编手册。

还有一个反直觉的体积账:被妥善组织的库,未必是被妥善缩小的库。LoCoMo的策展存储最后比输入流大35%,策展在这里是精化(加结构、解引用、补定位符),不是压缩;PersonaMem 128k则稳定压缩到输入的四分之一。同一套方法,一个膨胀一个收缩,取决于材料。所以「整理=瘦身」这个等号不成立,整理也可能是在加注释、补索引。

早期记忆活下来了

检索成本剪刀口:日志爬升,GS持平

检索成本剪刀口:日志爬升,GS持平

存储健康度这块,结果比担心的乐观。

每个任务的快照可以重建存储的一生:链条四分之一处就已存在的文件,到链条尽头时,被删除和被整体重写的都只是薄薄一层,所有管理智能体手下都是如此。用论文的话说:这里报告的东西,没有一个是死于被遗忘。早期记忆没有被后浪拍死,它们活下来了,而且就是存储的骨架。

能力差异体现在关注的形式上:最强管理智能体的创建动作在四分之一处就归零,但编辑一路攀升,早期14个文件里只有一个没被它动过;弱模型则留下35个早期文件中的22个原封不动。更强的策展表现为更广泛的就地维护,而不是替换。好管理员不是爱拆旧建新,而是勤翻新。

维护本身不会变便宜:每个回合的策展轮次稳定在六到十二轮,全程不变,维护替代了创建,而不是努力本身下降。档案管理员的工资不会随档案室变大而打折。想清楚这一点,就不会对「记忆维护成本」抱有不切实际的幻想:它是一笔永续支出。

警讯:秩序在悄悄流失

唯一的坏消息在内容层面:分类法遵从度,存储对那五条「好书架」规矩的遵守程度,在大多数存储增长的过程中缓慢侵蚀。只有最强的管理智能体把它大致守住了。

也就是说:记忆库没有死于删除和遗忘,却在慢慢变乱。文件还在,内容还在,但「同级可区分」「父覆盖子」这些组织纪律在松动。这正是标题里「越记越乱」的实证,不是爆炸式的崩坏,是温水煮青蛙式的松懈。

这个警讯对日常使用AI的含义很直接:你的AI记忆文件不会哪天突然打不开,它只会一点一点地变得不好找。等你发现「咦,这条信息明明记过怎么搜不到」的时候,侵蚀已经发生了很久。对抗它的办法只有一个:定期人工巡视,就像档案室要定期盘点。

今天测到的时程是140个任务和一段对话的长度;真正的长时程,几个月、几万条记忆,这套侵蚀会走到哪一步,论文没测,也坦承那是下一步要探的地方。但趋势已经画出来了:秩序是消耗品,不维护就会衰减,而最强的管理员也只能减缓,不能免除。

这一章的答案合起来是个双刃:积累是资产,经验可以替代能力;但维护这笔账永远在付,而秩序的衰减是慢性的、无声的。好消息足以让人放心用文件系统记忆,账单和警讯足以让人别对它撒手不管。

还剩下最后一个变量没检查。它藏在所有人的眼皮底下,却没人想过要拨动它。

第八章 换一套工具,换一种记忆

前四章拨动的旋钮有材料、有模型、有规模。第五个研究问题拨动的是一个所有人都忽略的变量:工具。

这个变量被忽略得如此彻底,以至于它值得单独一问:为什么没人测过?原因大概是工具在大多数人眼里只是管道,内容才是主角,管道长什么样有什么关系?论文证明:关系大了。工具不只是管道,工具是模具。

道理很简单,AI是通过工具操作记忆文件的,不同的工具箱等于不同的操作界面。给管理员发一套精细的文件编辑工具,和给他一个命令行终端,他干活的习惯会完全不同。但此前没人把「只换工具、其余全冻结」做成实验。这篇论文做了。

同一份材料:2个文件,或者147个

两套工具箱,长出两种记忆形状

两套工具箱,长出两种记忆形状

PersonaMem 128k,同一个模型,同一段对话,只换工具箱。对比刺眼得稳定:

两套文件工具(默认六操作,以及加了BM25的版本)都把整个人设折叠进一两个内容丰沛、标题层叠的大文件。而Shell工具箱,直接给一个bash命令行,把同样的内容打散成147个小文件。

两个数量级的文件数差距,改变的只有工具。模型没变,材料没变,指令没变。唯一变的是手里拿的家伙。

这个差距大到需要停下来消化一下。我们习惯把记忆库的形状归因于「谁建的」(模型的脾气)或者「建的是什么」(材料的结构),论文这里给出了第三个答案:用什么建的。同一个灵魂,换一个身体,行为方式就变了。

LoCoMo上画面没那么稳定:同一个配置跑两次,一次建出2个文件,一次建出29个(推理模型在提供方设定的努力档下采样,存储形状天然带运行间变异)。但方向性的签名是可靠的:给一个精通文件和目录的shell智能体一长段密材料,它会分区;而文件原生编辑倾向更少、更大的文件。shell用户天然爱开目录,编辑器用户天然爱写长文。

形状天差地别,答案基本一样

这些形状迥异的库,答起题来却差不多。LoCoMo上三套工具的正确率咬在86.1到86.7%之间,文件数差距那么大,分数几乎不动。PersonaMem 128k上61.9到66.7%,差距也就一两道题,落在单次运行的变异范围里。

这不算零结果,它说明好几种组织方式都能服务检索,检索智能体会适应拿到手的任何结构。但它也给了「结构越细越好」的直觉一记提醒:细碎不等于更好,粗整也不等于更差。组织是手段,不是目的。

更有意思的是检索智能体的自适应:多文件存储上,BM25被频繁调用(LoCoMo的查询里被叫了54次,用排序检索在29个文件里缩小范围);单个巨型文件上,它几乎不碰BM25(PersonaMem 128k上只调了2次),改走目录逐节阅读。同一个智能体,同一个工具箱,面对不同的布局自动换策略,组织和检索之间出现了一种没人指挥的耦合。

这个自适应本身是个好消息:你不用太担心把记忆建「错」了形状,检索端会自己找路。但别高兴太早,适应不等于免费,下面技能场景会告诉你,形状照样能影响成败。

顺便说一句这个现象对研究者的意义:检索智能体没有被明确告知「多文件时用BM25、单文件时走目录」,它是自己摸索出来的。工具的使用策略随存储形状自适应,这意味着「工具集」和「存储」之间存在一种隐性的协同演化。设计其中一端时,其实已经间接设计了另一端。这种耦合以前没人量化过,论文是头一个把它摆上台面的。

技能场景:工具翻了盘

对话场景里工具只改形状不改分数,技能场景里,同样的轴劈出了不同的结果。

给默认工具加一个排序检索(Center+BM25):检索智能体用上了新工具(整条链219次调用),管理智能体的库从45个文件变成76个,行为变了,结果没变(净差2个任务,p≈0.85,统计打平)。加一个工具,改变行为但不改变结局。

把整套工具换成Shell:结果动了。Shell链是中档管理智能体在任何工具下跑出的最好成绩(82.9%),显著超过Center+BM25(净+11,p≈0.04),对默认工具也有优势倾向(净+9,p≈0.06),家族提升面最广,加热任务81%,甚至超过最强管理智能体的水平。一个工具箱的替换,打出了比升级模型还大的收益。

存储能解释一部分:同一个中档管理智能体,走bash建出了文件层面最整合的库(36个文件,对比默认的45个),同时保住了内部结构(107个章节对99个),而且没有任何工具侧的校验帮忙,格式照样守住。shell逼着它想清楚结构再动手,反而建出了更整合的库。

还有一个容易误读的账,论文专门做了澄清:乍看之下,Shell存储比整合存储大了五成(PersonaMem 128k上275KB对177KB),像是「碎片化更费钱」。但把建库的美元账按统一价格重算,三家其实接近打平(11.4美元对13.5美元量级)。之前看起来的「两倍Shell溢价」,多半是跨运行比价的假象。所以工具的选择主要改变的是形状和结局,不是直接的美元成本。这笔账不澄清,很容易得出「换工具太贵」的错误结论。

工具是杠杆,不是包装

两个场景拼起来,规律是:加一个工具,改变行为但不改变结果;整套替换工具,重塑存储本身,只是方向和收益随场景翻转。长对话上,Shell把记忆打碎,质量打平;技能上,Shell把记忆整合,还赢了。

同一把锤子,在对话场景敲出了碎片,在技能场景敲出了整体。锤子没变,变的是场景奖励什么。长对话奖励「快速浏览定位」,碎片化恰好服务这个;技能奖励「致密的程序性指导」,整合恰好服务这个。工具的效果永远要放在场景里读。

所以工具挂具不是中性的管道,而是一根杠杆,它的效果由场景奖励什么来中介:长对话适合细碎的浏览,执行引导适合致密的程序。

这对实践的含义很直接:你在给AI智能体选工具集的时候,你不只是在选操作界面,你是在为它的记忆塑形。给它一个shell,和给它一套六操作文件工具,半年后你会得到两种完全不同的记忆库。选型之前,先想清楚你要它长成什么形状。

这个发现还有一层更深的含义:它意味着「记忆设计」和「工具设计」其实是一件事的两面。想改变记忆的形状,未必要去训练模型或重写提示词,换工具可能就够了。这是一条被所有人忽略的捷径,论文第一次把它画了出来。

五个研究问题全部过堂完毕。下一章把证词收拢:这一切到底意味着什么,以及它和你,一个不训练模型、只是使用AI的人,有什么关系。

第九章 这件事和你有什么关系

五个发现摆在一起,先收拢成一句话:文件系统记忆能用,会随积累变好,但「整理」本身从来不是答案质量的来源,真正的杠杆是材料大小、读记忆的能力、服务的形式和工具的选择。

回顾一下过堂结果,方便对照:AI建的记忆库形状是模型的签名,不是材料的形状;整理省一半检索成本,但买不来更好的答案;模型能力花在「读」和「蒸馏」上,不花在「写」上;记忆越积越值钱,也越积越乱;换一套工具,换一种记忆。五条里,每一条都在修正某个流行直觉。

这个结论的位置,放在更大的图景里看会更清楚。

和另一项研究对上了

今年早些时候,苏黎世联邦理工学院的研究者测了AGENTS.md这类AI上下文文件:让LLM自动生成的上下文文件,平均让任务成功率下降约3%,推理成本涨20%以上;人工维护的也只是勉强扳回4%。方向完全一致,自动生成、自动维护的记忆结构,不必然有用,甚至可能帮倒忙。

两项研究从不同角度撞上了同一堵墙:我们对「AI需要整理好的记忆」的直觉,可能系统性高估了整理对质量的贡献,低估了它对成本的贡献。整理不是免费的善举,它有成本,而它的收益常常只体现在「省钱」上,不体现在「答好」上。

当然,也要避免走向另一个极端,「整理无用论」。这篇论文说的是「整理不直接提升答案质量」,不是「整理无用」。它明确测出整理能省一半检索成本,能在弱执行智能体手下翻盘。整理是有用的,只是它的用处和大多数人以为的不一样。

这篇论文没回答什么

公允起见,把局限也摆上桌。一篇敢把「我们没测什么」写清楚的论文,比一篇假装无所不能的论文可信得多。

时程短。测到的积累最长是140个任务和一段对话的长度。真正的痛点场景,一个AI助理陪你工作几个月、攒下几万条记忆,没人测过,作者自己说那是下一步。140个任务里没崩,不代表1400个任务里不会崩。

质量基准对形状失明。这是论文自己提炼的开放问题:如果存储形状变来变去而对话答案纹丝不动,那到底什么时候组织才重要?是规模超过一段对话之后?是跨越数月的长时程里?还是在「保持可导航」这个可持续性维度上?现有的答题基准测不出来,因为它们只考「答得对不对」,不考「找得快不快、库乱不乱」。

单次构建的抽样波动。推理模型建库带有运行间变异,同一个配置两次建出2个文件和29个文件。论文把文件数读作「特征行为」而不是常数,这个诚实的保留也应该被转述。你复现这篇论文的某个具体数字时,可能得到不同的文件数,那不是你的错。方向性的结论(谁整合谁碎片)是稳的,具体数字是浮动的。

另外要说明:这篇论文的基准都是英文语料(对话、人设、家务指令)。中文场景下的结论大概率方向一致,但具体数字没人验证过。把它应用到中文产品时,留一分余地。

对你意味着什么:五条可以今天就用的

如果你在用带记忆的AI,编程助手、长期助理、任何有「记住这个」功能的产品,这篇论文给了五条可以直接落地的判断。

第一,定期给你的AI的记忆做减法。论文里AI的记忆库只会创建和编辑,几乎从不删除,秩序随增长侵蚀。你的AI的记忆文件大概率也在变乱。每隔一段时间打开那个文件(它们就是明文markdown,这是文件夹方案最大的好处),把过期的、矛盾的、重复的删掉。这件事AI自己做不好,它连重组时都会偷删有用的东西,主动维护还是得靠人。

第二,记忆写给「读」的一方,不是写给「存」的一方。检索能力才是答案质量的单调来源,而检索吃的是「好找」:名字清楚、一行说明讲清内容、相关的事情放在一起。下次你往AI的记忆里加东西,别问「这条信息完整吗」,问「三个月后另一个上下文里的AI,看到这行描述能找到它吗」。

第三,警惕「AI帮你整理记忆」。放任模型重组记忆,它默认会压缩丢细节,加一条「保留所有事实」才止住。如果你的AI产品有「自动整理/总结记忆」的功能,整理前后对一眼关键内容,特别是那些你很久没提但依然重要的约定。别让它趁你不注意,把你的重要约定「精简」没了。

如果实在不放心,有个土办法:整理之前把记忆文件复制一份存档。AI整理完,你拿旧版和它并排扫一眼,看有没有哪条你眼熟的内容消失了。这比信任任何「智能摘要」都可靠,而且只花你三十秒。

第四,工具选择本身在塑造记忆。给AI shell还是给文件工具,会长出147个碎片或2个大文件这样不同的库。这不是理论问题:你用不同界面、不同产品对接同一份长期记忆,得到的组织形态就是不同的。选工具时多问一句:这套工具会让记忆长成什么形状?

第五,弱模型加好记忆,可能比强模型加差记忆划算。弱执行智能体靠积累的经验从51%爬到91%,GS式记忆每解决一个任务只要5.7美分。预算有限时,把模型档次省下来的钱投进记忆的质量,尤其是投进「读」的那一端,大概率是赚的。

尾声:第一张整理说明书

回到开头那张办公桌。

AI的笔记本确实越记越乱,这不是悲观的判决,而是这篇论文给出的、第一个基于测量的描述:乱的方式(组织侵蚀)、不乱的部分(早期记忆存活)、乱的代价(检索账单随日志膨胀),都有了数字。有了数字,就有了着手点。怕的是「不知道会不会乱」,现在知道了:会乱,以什么速度乱,乱到什么程度,都画得出来。

它也给了第一张整理说明书:别迷信整理本身,没有任何AI把整理直接变成更好的答案;把力气花在会读记忆的那一方;给原始日志配一个强脑子,或者给弱脑子配提炼好的指导;工具是塑形的手,不是中性的管。这四条,够任何一个搭AI记忆系统的人少走几年弯路。

全世界的AI都在用文件夹记日记。现在,终于有人认真读过这些日记了。读完的结论不复杂:它们会越记越乱,但乱得有规律;整理值得做,但别指望它换来聪明,它换来的是省钱和长久。

对你来说,这意味着下次AI忘了你的事,别急着骂它健忘。先打开它的笔记本看一眼,很可能,那里面记着呢,只是它自己已经找不到了。

*本文基于 arXiv:2607.26637《Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability》(Zhou et al., 2026, CC BY-NC-SA 4.0)撰写。*

延伸阅读

  • 本文论文:Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability(arXiv:2607.26637,Zhou et al., 2026,CC BY-NC-SA 4.0)
  • MemGPT:把LLM上下文当操作系统分页内存管理的开创性工作(arXiv:2310.08560)
  • MemCon:让记忆管理策略自己学习何时检索、何时遗忘(arXiv:2607.13591)
  • FARMA:投毒智能体推理史的攻击与防御,记忆安全的另一面(arXiv:2607.05029)