上周两件事前后脚发生:智谱发布 GLM-5.3-Flash,320B 总参数每 token 只激活 18B,价格打到前代的十分之一;阿里开源 Qwen3.8-Flash-Next,125B 主模型加 51B N-gram 嵌入、每 token 激活 6B,训练成本只有上代的九分之一(来源:Tech Digest 8月27日·智谱官方发布、Qwen 官方博客)。
单看都是熟悉的剧情:又便宜了。但把两件事放在一起,再对照《Token工厂:生产易,消纳难》里那句话——AI 时代真正被商品化的是 Token 化的智力产能——你会发现价格战讲的故事已经变了。这次降价降的不是毛利,是架构;比的也不再是单价,是任务。
图注:稀疏激活把每 token 的计算量压到总参数的零头,价格战的弹药来自架构,不是补贴。
这次降价降在架构里
先看钱从哪省出来的。GLM-5.3-Flash 首次采用稀疏注意力与线性注意力混合设计,配合流形约束超连接(mHC)和 30T token 多模态预训练语料,把长上下文的服务成本大幅压低。这是 GLM-5 系列第一个原生多模态模型,却在编码与智能体基准上逼近 Claude Opus 4.8(来源:智谱官方发布)。
Qwen3.8-Flash-Next 走得更远,四个维度同时动刀:GDN 加稀疏注意力 QSA 的混合架构压长序列成本,门控残差增强跨层信息流,N-gram 嵌入用查表方式低成本扩容,优化器换成 Muon。原生支持 262K 上下文,YaRN 可扩展到 1M,生产版 Qwen3.8-Flash 定价输入 0.16、输出 0.47 美元每百万 token(来源:Qwen 官方博客)。
还有个细节值得注意:两家发布前都把模型以匿名代号丢进 OpenRouter 和 OpenCode 公测。GLM-5.3-Flash 以"ox-alpha"之名成为当周最受欢迎模型,全部流量跑在国产 AI 芯片上。模型的试炼场已经从发布会挪到了智能体的调用日志里——先让机器用,再让人评。开发者和智能体不会给任何厂商面子,跑不通的任务就是跑不通。
考核单位从"回答"变成"任务"
每百万 token 多少钱,这个指标正在失去意义。智能体干活不是一个来回:一次真实的编码任务,规划、调工具、读报错、返工,动辄几十次模型调用、几十万 token。单 token 价格乘以几十,才是用户真正付的账。
所以两家新模型的评测口径全换了。GLM-5.3-Flash 报的是"每任务 0.045 美元",在 Artificial Analysis 智能指数拿到 57 分——上一代要贵约十倍的价格才能买到的智能,被拉到了白菜价。Qwen3.8-Flash-Next 报的是 DeepSWE 1.1 得分 58.7、Toolathlon 73.5,两个都是智能体任务基准,考的是把活干完,不是把话说漂亮(来源:Tech Digest 8月27日)。
《揭秘:相同模型在不同渠道Token价格差异的3点原因》里有个观察可以互印:同一个模型在不同渠道的 Token 价格能差出数倍,差异不在模型本身,在路由策略、缓存命中和并发调度。换句话说,当模型单价趋同之后,谁能把"每个任务的完成成本"压下来,比拼的恰恰是这些工程层的功夫,而不是发布会上的报价单。
返工率这个变量更隐蔽,也更大。基准测试上的得分只说明模型"第一次能做对"的概率,智能体任务里真正吃钱的是做错了要推倒重来。一个 85% 完成率和 92% 完成率的模型,账面能力差七个点,任务成本差出来的是一整轮重试的 token。这也是为什么各家开始把 DeepSWE、Toolathlon 这类端到端基准放到宣传页第一屏:答案的对错可以装,任务的完成装不了。
图注:智能体时代的账本:单价×调用次数×返工率,三个变量里只有第一个在降。
价格地板,谁来消纳
降价的另一面是《Token工厂:生产易,消纳难》点破的困境:电价在 Token 成本里只占约 15%,便宜电只是入场券不是护城河;产能扩张容易,真实业务的持续消纳才是难点。现在模型单价又在以十位数往下打,上游更挤了。
该文引了中国信通院云计算与数字化研究所主任马飞一个判断:Token 调用量增长,一半来自用户规模,另一半来自机器调用——智能体自己调模型,正在成为新的增长来源。人一天问几十句,Agent 一天跑几千轮,消纳的出口其实被打开了,只是出口不在聊天框里,在业务流程里。
三个便宜模型能力接近一线,采购方的算盘立刻变了:不再赌一家,而是按任务分发。简单改写用 Flash 级,复杂规划留给旗舰,长文档交给支持 1M 上下文的,路由本身成了价值环节。这跟《Palantir CEO 亲自谈 FDE》里那句"买 Token 创造不了价值"并不矛盾——Token 便宜了,把 Token 变成业务结果的工程反而更贵、更稀缺。算力方管生产,模型方管价格,消纳这一环空着,谁接上谁吃肉。
源势AI观点
我们的判断是:2026 下半年的竞争焦点,从"谁的模型便宜"切换到"谁的任务完成成本低"。这也是我们做 Token 聚合平台的出发点——20 多个模型接在一个 API 后面,智能路由按任务复杂度、实时价格和历史成功率选路,企业账单平均降三到五成。
降价对买方是好消息,对卖方是倒计时:当智能本身趋于免费,剩下的差异化只有两件事——把任务路由到对的模型,把模型输出接进对的业务流程。单价是别人的战场,路由和消纳是我们的。谁掌握路由,谁才有议价权;谁能把 Token 送进真实业务流程、变成可验收的结果,谁才吃得到这波降价的红利。