智谱在8月发布了GLM-5.3。和上一版相比,基座模型没变,参数量也没涨,但多项能力指标出现了可感知的提升。这些改进全部来自后训练。
这件事本身就是一个信号:大模型的进化路径正在分化。
预训练到了什么阶段
过去几年,行业对"大模型"最直觉的理解就是参数越大越强。GPT-3的175B、Gopher的280B、MT-NLG的530B,一路往上堆。
但2022年DeepMind做了一件关键的事:用同样的算力预算,训练了400多个不同规模的模型,发现与其把参数做大,不如让模型看更多数据。他们给出了一个经验值——每个参数大约配20个Token的训练数据,并以相同速率增长。
图注:DeepMind Chinchilla实验揭示的参数量与训练数据最优配比关系
70B参数的Chinchilla用1.4T Token训练,在差不多的算力下超过了280B的Gopher。一个训练更充分的小模型,可以打赢一个没喂饱的大模型。
这给行业的启示很明确:预训练不是单纯堆参数,而是参数、数据、算力三者的配比优化。到了今天,头部厂商的预训练投入依然巨大——Kimi K3总参数达到2.8T,字节的模型据传也在朝10万亿级迈进。但规模本身已不是唯一的竞争力。
后训练成了主战场
预训练给模型打底子,后训练把底子变成能力。GPT-3时代,预训练承担了能力提升的绝大部分工作,后训练只做最后一层对齐——让模型学会聊天、遵循指令。
到了2026年,格局完全变了。智谱GLM-5.3的Model Card显示,基座不变、参数不变,但推理、代码、工具调用等维度均有提升,改动全部集中在后训练阶段。具体手段包括强化学习(RL)、工具环境中的轨迹训练、以及更精细的对齐策略。
GLM-5.3不是孤例。智谱在过去一年的几次迭代中,基座模型的更新频率明显放慢,而后训练的改进节奏越来越快。这条路的好处是效率高——不需要重新跑一轮耗资巨大的预训练,就能在关键能力维度上持续迭代。
从产业视角看,后训练的成本远低于预训练。一次完整的预训练需要数千张GPU跑数周,而后训练可以在同一基座上反复实验。这意味着拥有好基座的团队,可以通过密集的后训练迭代建立持续优势。
后训练到底在练什么
GLM-5.3的后训练改进,核心在三个方面。
第一是推理能力。通过思维链(Chain-of-Thought)强化学习和数学推理轨迹训练,模型在复杂逻辑任务上的表现明显提升。这不是让模型记住更多知识,而是让它学会"怎么想"。
第二是工具调用。Agent场景要求模型准确选择工具、构造参数、处理返回结果。这类能力几乎完全靠后训练阶段的RL来塑造——预训练只提供了语言理解的基础,工具使用的"肌肉记忆"必须在交互式环境中训练。
第三是对齐质量。让模型在该拒绝时拒绝、该详细时详细、该简洁时简洁。这种"分寸感"是RLHF和Constitutional AI等后训练技术的核心目标。
根据智谱公开的Benchmark数据,GLM-5.3在MATH-500上得分提升约4个百分点,代码竞赛类指标也有可观改善。这些数字背后的含义是:同一个基座,经过不同的后训练配方,可以产出差异显著的产品。
源势AI观点
后训练Scaling正在成为大模型竞争的分水岭。当预训练基座趋同——同样的架构、类似的数据、接近的参数量——差异化就落在了后训练上。谁能在RL环境设计、轨迹数据质量、对齐策略上持续迭代,谁就能在同一个基座上不断推出更强的版本。
这对产业格局有两个直接影响。其一,"基座即平台"的模式会加速:少数团队做预训练基座,更多团队在后训练层做垂直优化。其二,后训练的工程壁垒并不低——RL环境的设计、奖励函数的调校、轨迹数据的清洗,每一项都需要深度积累。后训练不是"调调参"那么简单。
GLM-5.3证明了一件事:在2026年,不加大模型,也能让它变强。关键不在大小,在训练的方法论。
---
*来源:*
1. *AI产品阿颖《对GLM-5.3的真实评价》(2026-08-14)*
2. *DeepMind《Training Language Models to Generalize》(Chinchilla, 2022)*
3. *Kaplan et al.《Scaling Laws for Neural Language Models》(OpenAI, 2020)*