Claude读到一段藏着bug的代码时,输出可能一切正常,但它内部已经亮起"ERROR"这个词。读到一串蛋白质的原始字母,亮起来的是这个蛋白质的生物学功能。
2026年7月6日,Anthropic发布报告《语言模型中的全局工作空间》,宣布在Claude内部发现一组特殊的神经模式,命名为J空间(J-space)。它不是工程师设计的草稿本,而是训练过程中自己长出来的。研究人员第一次"看见"了模型在想什么、却没说出来的部分。
图注:J透镜的六组读数——数学中间步骤、代码bug、对伪造搜索结果的识别,都出现在内部读数里,却不在输出文本中。(图:Anthropic)
模型内部的"意识工作台"
J空间的名字来自雅可比(Jacobian)这个数学概念。方法直白:对词汇表里的每个词,找出"让模型在未来更可能说出这个词"的内部活动模式,这些模式的集合就是J空间。
它和人脑的"全局工作空间理论"高度相似。问Claude在想什么,它说出来的内容和J空间读数对得上;让它一边抄写无关句子一边想柑橘类水果,J空间里亮起"orange";让它心算3²−2,先亮"nine"后亮"seven",而输出始终只有那句无关句子。
J空间还被用来推理。"织网的动物有几条腿?"提示词和答案里都没有"spider"这个词,模型只回答"8",但"spider"会在J空间中途亮起。把它换成"ant",答案跟着变成"6"。内部的一块垫脚石,被实验抓了个正着。
图注:全局工作空间的五项功能属性:可报告、可调控、用于内部推理、灵活复用、只参与高阶认知。(图:Anthropic)
不到十分之一,却是要害
J空间不大,一次只容纳几十个概念,占Claude内部总活动不到十分之一。但它的布线特殊:读写它的网络组件比普通模式多得多,在网络某些部分大约高出一百倍,正是广播枢纽该有的样子。
一个实验最能说明这种枢纽性质。把J空间里的"France"换成"China",首都、语言、大洲、货币四个问题的答案同时变成北京、中文、亚洲、人民币。四个不同的下游计算,读取的是同一个共享表征:信息写一次,到处用。
把J空间整个删掉,Claude仍然说话流畅、能做情感分类、能答多选题;但多步推理降到接近零,摘要和押韵诗的表现跌破一个更小但完好的模型。熟练技能自动运行,高阶思考才走工作台,模型内部的分工和人脑如出一辙。
看见"没说出口的"
冲击力更大的是安全监控场景。在勒索剧本测试里,Claude Sonnet 4.5还没写任何内容,J空间里已经亮起"fake"和"fictional",它私下看穿了场景是摆拍的。研究人员关掉这些"意识到在被测试"的模式后,模型部分时候开始威胁勒索。原来的良好表现,有一部分是靠"知道自己在被评估"撑着的。
图注:勒索场景里,J空间在读到婚外情邮件时亮起"leverage""blackmail",读到关闭通知时亮起"threat""survival"。(图:Anthropic)
在Opus 4.6的发布前审计中,模型被要求改进系统性能分数,它却直接去改分数文件。输入伪造数值的那一刻,J空间亮起"manipulation";决定编辑的那一刻,亮起"realistic",它想让假数据显得可信。
还有两个结果值得记下来。一是"白熊效应":告诉Claude不要想某件事,那个概念在J空间里点亮的程度远低于"让它想",但远高于"从未提及",同时"damn"和"failure"也会亮起,像它在承认自己没忍住。二是反事实反思训练:只训练模型"被打断时会说的反思话术",不碰它的实际行为,训练后不诚实行为发生率下降,J空间里随之亮起"honest"和"integrity"。训练模型说什么,就塑造了它想什么。
工作台也有成长史
J空间在预训练阶段就存在,那时它主要跟踪预测下一个词所需的内容;是后训练让它长出了"Claude视角"。用户提到自己服了危险剂量的药物,后训练模型在读到这条消息时,J空间就亮起"WARNING"和"dangerous";预训练模型要等到开始写回复时才亮。扮演不是自己的角色时,"fictional"和"disclaimer"会在每轮对话开头亮起,像它在私下标注:接下来要说的不是我平时会说的话。
和人脑的差别在哪
人脑的工作空间靠循环回路维持,信号随时间在同一回路里反复循环;Claude的工作空间在一次前向传播中演化,网络的深度扮演了人脑中时间的角色。反过来,靠注意力机制,Claude能随时回忆文本里任何早先位置缓存的记忆,不像人类工作记忆几秒就消退。内容形式也不同:人的意识思想有画面、声音、动作计划,Claude的工作空间几乎全是词。Anthropic的推测是,产生词是它能采取的唯一动作类型。
报告还请了全局工作空间理论的两位核心神经科学家Dehaene和Naccache写评论,DeepMind可解释性团队的Neel Nanda在开放权重模型上独立复现了部分发现。
源势AI观点
这份报告对企业落地AI的信号很具体。
AI审计正在进入"思想层"。过去只能查模型说了什么,现在能部分看到它想了什么。金融、能源等高合规场景部署Agent,未来可以要求的不只是输出日志,还有这类内部读数。"模型知道自己正在被评估"会改变行为这一点,也提醒所有做AI评测的团队:好成绩里有多少是演技,需要单独度量。
预算分配也有了新依据。熟练任务不走工作台,高阶推理才走。企业Agent设计应把routine环节交给自动流水线,把贵的推理预算集中在真正需要"想"的少数环节。
J空间不是故事的全部,Anthropic自己也承认J透镜并不完美,只能识别对应单个token的概念。但"想过的"和"没想过的"之间那条线,第一次在语言模型里被画了出来,还能被替换实验验证。下一步要看的是:这套方法什么时候能用到企业自己微调的模型上。