去一个陌生地方,我们还没出发,脑子里已经预演过路线了。下棋会想几步之后的局面,面对没遇到过的问题也会先试几个可能的答案。身体没动,大脑已经在生成可能的未来。上个月发表在《Nature机器智能》上的一项研究,给出了一个简洁的神经计算模型来解释这件事。(来源:《大脑如何"想象"出一条通往目标的路》清熙/王庆法,文献:Nature Machine Intelligence 2026, s42256-026-01254-4)
这个模型叫GCML(Generative Cognitive Map Learner),把四样东西拼在一起:认知地图、逆模型、随机采样、组合编码。
图注:记忆按关系组织成地图,想象是沿着地图采样未来。
认知地图存的是关系
要理解这个模型,先理解"认知地图"。
我们记住一个地方,真正有用的信息是关系:这里可以到那里,从A到B可以经过C,某个位置有障碍,从当前位置怎样到达目标。所以认知地图本质是一种按"状态与动作之间的关系"组织经验的数据结构。
对空间任务,大脑用的是基于网格细胞的认知地图,通过路径积分把运动信息转换成空间位置表征。对抽象任务,模型把观察和动作嵌入到同一个高维状态空间,让这个空间的几何结构表达状态之间的关系。"地图"只是个形象说法,可以是房间之间的空间,也可以是抽象任务里的状态空间。(来源:《大脑如何"想象"出一条通往目标的路》)
这里有一个已有神经科学实验的支持:动物休息期间,海马体重播中会出现可以解码为未来运动轨迹的位置细胞序列;当环境出现新障碍时,这些内部轨迹还能重新规划绕行路线。
逆模型负责定方向
光知道"做了某个动作会发生什么",还不足以规划。规划真正要回答的问题是:我想去那里,现在该做什么?
这就是逆模型的作用。前向模型描述"动作→状态变化",逆模型反过来,描述"状态变化→动作"。
这里有一个很漂亮的几何直觉:认知地图把不同状态组织进一个有结构化几何关系的向量空间,只要这个空间的状态变化足够平滑,两个状态的向量差就包含了从当前位置指向目标的大致方向。所以模型不需要真的走到目标附近才知道下一步怎么走——它只学会很多局部的"动作-状态变化"关系,逆模型把这些局部经验汇总起来,就能判断一个远处目标的大致方向。(来源:《大脑如何"想象"出一条通往目标的路》)
图注:认知地图保存关系,逆模型提供方向,采样生成未来。
先在脑内走一遍,而且走很多遍
让GCML变成生成模型的关键一步来了。
真实行动时:采取动作→环境变化→得到下一个状态。想象时:身体不动,模型把"环境反馈"换成自己的预测——选一个虚拟动作,前向模型直接预测下一状态,再把这个预测状态当成新的当前位置,继续选下一步虚拟动作。如此循环,整个过程没有执行任何真实动作,只是在"过脑子"。
如果每步都严格按逆模型的方向走,得到的是一条确定轨迹。但在动作选择里加入高斯噪声,每次生成都会略有不同:同一个起点和目标,可以走出A→B→C→D,也可以走出A→E→F→D。这就是论文所说的神经采样——模型不算唯一答案,而是在内部反复生成可能轨迹,输出的是一个"目标条件下的候选未来集合"。
随机图实验显示:低噪声时,生成的路径大多接近最短路径;提高噪声后路径多样性明显增加,但多数轨迹仍能到达目标,即便某一步走偏,后续动作也会重新朝向目标。当不同节点被赋予激励和损失时,更高的噪声能产生更多样的候选路线,从而增加找到高奖励路径的机会。想象的作用不只是把未来预测得更准,还在于扩大候选未来的搜索范围。(来源:《大脑如何"想象"出一条通往目标的路》)
图注:同一目标可以有多条候选路径,噪声让未来保持多种可能性。
能解没见过的组合题
这个模型还有一项能力:处理训练中没见过的新状态组合。
论文选了一个看似简单、实则NP-hard的任务:给定若干基本图形块,判断一个复杂轮廓能不能由这些构建块分解出来。训练阶段只学由5个构建块构成的轮廓分解;测试阶段换成8个构建块的全新轮廓,训练中从未出现。GCML依然能通过目标导向的想象完成分解,并且明显优于随机移除构建块的基线和确定性的CML。(来源:《大脑如何"想象"出一条通往目标的路》)
靠的是组合编码:模型学的是组成状态的结构和动作关系,面对新组合时可以重新利用已掌握的局部关系。经验不需要覆盖所有具体状态,只需要覆盖足够多的组成结构。
这一点在工程界有呼应。腾讯混元等团队的EnvACE(arXiv:2608.06197)做的是同一方向的另一半:让Agent在训练时用"世界排演"替代真实环境交互——策略先生成工具调用,再自己扮演环境生成响应,把动作与环境响应的关系内化进参数里,在BFCL-v4、τ2-Bench等基准上超过环境扩展基线。大脑用认知地图在内部采样未来,EnvACE用参数化的世界模型在内部排练,两条路线指向同一个判断:先在内部走一遍,再真动手。(来源:arXiv:2608.06197 EnvACE, 上海交大/浙大/腾讯等)
源势AI怎么看
这篇论文最值得注意的,是它对"记忆"的重新定义:记忆提供结构,回忆是沿结构重新访问过去,想象是沿结构采样可能的未来。记忆不只是存档,它是一台未来生成器。
对我们做Agent落地的人,这里有个很具体的启发:传统强化学习围绕"状态→动作→奖励"学策略,策略和目标绑死,换个目标要重新训练。GCML把地图和目标分开——地图保存"世界怎样连接",目标决定"现在想去哪里",同一张地图可以服务不同目标。这和我们做企业Agent时的经验一致:把环境关系、业务规则沉淀成结构化的状态空间,比让模型对每个具体任务从头学一遍,泛化得更稳,改起来也便宜。
下一步值得关注的问题也清楚了:内部状态空间需要怎样的几何结构,才能让系统在其中真正"走一遍"?这个问题对大脑开放,对Agent工程同样开放。