图:模型内部情绪信号正在成为Agent技能路由的新维度
AI有情绪吗?不是拟人化的比喻,是模型内部真实存在的、可测量的、能影响决策的情绪向量。
2026年4月,Anthropic发布研究,发现Claude模型内部存在171个情绪向量,这些向量存在于残差流中,被放大或抑制时会因果性地改变模型行为。一个月前,Transformer Circuits团队发表了"Emotion Concepts and their Function in a Large Language Model",从模型激活中提取出了线性的情绪概念表示。
这些情绪向量不是隐喻,是数学对象。它们可以被提取、编码,甚至注入到Agent的决策流程里。
情绪信号驱动技能选择
中科大与牛津大学联合团队的Emotion2Skill框架,把这个想法做成了系统。论文发表于2026年8月(arXiv:2608.09248),核心思路是:在每个决策步骤,从Qwen3模型的残差流中提取27维情绪状态,通过编码器映射为自然语言情绪模板,注入到技能选择的提示词中。
效果显著。在ALFWorld基准上,Qwen3-8B的零基线成功率只有21.9%,加入情绪信号后提升到47.4%,提升25.5个百分点。在WebShop上,成功率从2.8%提升到29.7%。Qwen3-14B版本上,ALFWorld成功率从23.4%提升到52.3%。
论文还发现情绪-技能之间存在可解释的共激活模式:confusion(困惑)与P.Search技能共激活,curiosity(好奇)与Navigate共激活,disappointment(失望)与技能进化阶段的改写触发高度相关。这些不是黑箱统计,是可语义解释的路由规律。
图:Emotion2Skill框架的三阶段流程(来源:arXiv:2608.09248)
安全Harness也能进化
情绪向量不只是提升性能,还能做安全。上海人工智能实验室同期发布的SHE框架(arXiv:2608.09885),走的是另一条路:让Agent的安全边界从固定策略变成可进化对象。
SHE把安全Harness拆解成四个可编辑组件——系统提示词、规则库、安全记忆、工具策略。每个组件有明确的安全职责边界。当Agent执行轨迹中出现失败案例时,SHE通过归因诊断定位问题出在哪个组件,然后只改那个组件,不动其他部分。
这套设计解决了一个核心矛盾:传统安全机制把Harness当固定部署物,但风险在不断演化。SHE让安全边界跟着风险一起进化,从"事后打补丁"变成"轨迹驱动的持续学习"。
图:SHE框架将安全Harness拆解为四个可独立进化的组件(来源:arXiv:2608.09885)
为什么这很重要
Agent的决策,此前完全依赖文本层信号——任务描述、语言反思、经验规则。模型的内部状态从未被利用。
Emotion2Skill和SHE代表了两个方向:一个把模型内部情绪状态变成决策信号,一个把安全机制变成可进化的活体。两者的共同点是——不再把大模型当黑箱,而是打开它、读取内部信号、用于Agent层面的决策和安全控制。
这个趋势和Obsidian笔记记录的Agent自我进化方向一致。Agent的进化不再只是外部反馈驱动,模型自身的内部状态正在成为新的信号源。情绪向量是可解释的、因果关联的、任务无关的,这让它们成为Agent内部决策状态的天然代理。
源势AI怎么看
在源势AI的Agent落地实践中,我们一直面临一个难题:Agent什么时候该切换技能、什么时候该放弃当前路径、什么时候该交回人工。目前这些决策靠的是规则和外部反馈,延迟高、粒度粗。
Emotion2Skill给出的思路——读取模型内部情绪状态辅助决策——对工程落地有直接启发。一个Agent在执行过程中如果"困惑"持续升高,这可能比外部错误码更早预警问题。安全Harness的可进化设计,则给企业级Agent的安全治理提供了新思路:不靠人写死规则,靠轨迹反馈持续迭代安全边界。
我们关注这些研究,不是为了给Agent装上"感情",而是把模型内部状态变成可工程化利用的信号。情绪向量从研究到落地还有距离,但方向值得跟踪。Agent的自我进化,需要的不只是外部反馈,还需要一把读内部状态的钥匙。