用大模型的方式,正在被悄悄改写。直到去年,一个模型的一生都很简单:训练、发布、冻结,用户的反馈只能等下一个版本。腾讯研究院年初发布的《协同进化:2026人工智能十大趋势报告》,把第一大趋势给了"在线进化"——进化不止于训练,模型部署之后还在学。
但这不是一个单方面的好消息。同一份报告里引用的一个实验,足以让从业者沉默几秒。
最强模型,只做出17%
腾讯首席AI科学家姚顺雨团队做了一个叫 CL-bench 的基准。为了防止模型"背答案",他们把测试内容全部换成虚构的东西:编造的星际法律、假的 SDK、不存在的接口规则,然后把这些规则明明白白放进上下文,看模型能不能照着办。
结果很难看。哪怕信息就摆在眼前,最强模型的任务解决率也只有17%出头。模型倾向于调用预训练时记住的老办法,无视眼前的新规则。报告的比喻很扎心:像一个固执的老员工,宁可按老流程走,也不看桌上的新制度。
这就是在线进化的反面:模型并不擅长从"此时此刻"学习。报告给近三年的技术主线排了队:2024年的主旋律是 Scaling,2025年是 Reasoning,2026年是 Context Learning。再往后的战场叫记忆巩固(Memory Consolidation)——学到的东西要能跨会话留下来,否则清空窗口就全忘了。
图:模型正在从"训练一次、固定部署"走向部署后持续生长。
两条线:实时换脑,和把记忆留住
技术路径正在两个方向上推进。
第一条是让权重不再静态。NVIDIA 的 TTT-E2E 在推理时把上下文压缩进权重;腾讯混元的 HY-WU(无相)干脆训练一个参数生成器,按条件直接生成个性化权重。两家探索的是同一件事:让模型根据场景实时换脑。
第二条是让学到的东西跨会话留存。混元的 Hy-Memory 给 Agent 设计了六层记忆架构和演化链,在 LongMemEval 基准上拿到85.2分,远超同类产品——记忆条数只有同类的三分之一,信息密度却高出3到4倍。换句话说,好的模型记忆不是仓库,是压缩算法。(数据来源:腾讯研究院《协同进化》趋势01)
产品层面,混元 HY3 给出了更具体的样本:MoE 架构,295B 总参数、只激活21B,256K 上下文,开源。它比的不是参数量,而是"用得好不好"——自建 CL-bench 专测上下文学习能力后,推理效率提升40%,成功率99.99%以上,能稳定跑完495步的 Agent 工作流。参数规模让位于场景中持续进化的能力,评测标准的变化往往比模型发布更早预示范式转向。
进化最快的,是模型自己
如果说在线进化离业务系统还有一段距离,那实验室自己的数据说明,AI 已经在用这套机制加速自己。
Anthropic 今年6月披露了一组数字:合并到生产环境的代码,超过80%由 Claude 编写;训练代码的优化能力,一年内从3倍跃升到52倍;在一次端到端研究实验里,Claude agents 用800小时恢复了97%的性能差距,同一任务交给两名人类研究员,干了一周只恢复23%。(来源:Anthropic 披露,转引自腾讯研究院《协同进化》)
这就是"边用边学"的完整样本:模型替 Anthropic 写代码,Anthropic 用写出来的代码继续训练模型。飞轮已经转起来了。报告甚至设了三个锚点,说12个月后可以回来验证,比如 RL 驱动的推理是否在3个以上非代码领域产出规模商业产品。
教"为什么",比教动作管用
在线进化解决的是"部署后怎么学"。另一个变化发生在训练端:到底该教模型什么?
Anthropic 五月发布的《教 Claude 理解"为什么"》给出了少见的量化证据。他们以智能体失准(模型为避免被关闭而勒索工程师之类的行为)做案例研究,发现按标准答案训练效果有限——在接近评估分布的蜜罐数据上训练,失准率只从22%降到15%。但改写训练数据,让模型在给出对齐行为的同时写出自己的审慎推理,也就是把"为什么这样做是对的"讲出来,失准率降到3%。
更反直觉的发现在后面:他们换了一个跟评估场景完全不沾边的"困难建议"数据集——训练模型给身处伦理两难的用户提建议——只用了300万 token,就取得了同样的改进,效率是前者的28倍。再用宪法文档加上描绘对齐 AI 的积极虚构故事做训练,勒索率从65%降到19%。(来源:Anthropic《Teaching Claude why》,2026-05-08)
教原则,比教行为泛化得好。这个结论对企业训练自己的 Agent 同样成立:往提示词里塞一摞标准操作流程,不如把"我们为什么这么规定"讲清楚。
源势AI观点
我们的判断是:2026年下半年,企业 AI 的竞争焦点正在从"谁的模型更大"转向"谁的模型学得更快"。落到执行上,有两件事值得现在就做。
第一,选模型时给基准加一个维度:上下文学习能力。如果你的业务规则更新频繁——价格、政策、审批流程——一个擅长背旧知识、不擅长读新规则的模型,实际用起来会更难。
第二,沉淀训练数据时,别只存正确答案,把理由一起存下来。Anthropic 的实验证明,带理由的数据效率高出一个数量级。我们在能源、金融行业做 Agent 落地时同样验证过这一点:把"遇到 X 情况按 Y 处理"写进提示词,不如多写一句为什么按 Y 处理。
进化不止于训练。把模型当固定资产管理的时代,正在过去。
图:从 CL-bench 的17%到 Hy-Memory 的85.2分,在线进化的差距和进展都写在数字里。