打开2026年6月的国内大模型价格表,你会看到一件怪事:DeepSeek V4-Flash每百万Token输出2元,智谱GLM-5.2每百万Token输出28元。同样是国产旗舰,价格差了14倍。

这不是笔误。大模型的Token定价正在裂成两个世界,一个往下坠,一个往上飘,中间的断层越来越大。

降的那一端:地板价还在往下压

DeepSeek在2026年4月连续两天降价。先是V4-Pro限时2.5折,接着全系API输入缓存命中价格降到首发价的十分之一,Flash版每百万Token输入缓存命中低至0.02元。高频调用、长文本场景的成本降幅超过90%(来源:人人都是产品经理《Token价格战真相》,2026年8月)。

字节火山引擎更直接。Doubao-Seed-2.0-Mini的输入价格压到0.2元/百万Token,输出2元,主打高吞吐批处理和极低成本。腾讯Hunyuan-A13B输出也是2元,定位Agent工具调用。DeepSeek V4-Flash输出同样2元,靠1M上下文窗口和缓存命中0.02元的价格抢RAG和批量自动化场景(来源:《国内大模型价格与Benchmark综合对比》全模型版,2026年6月)。

旗舰模型输出价格对比

图注:五家厂商旗舰模型每百万Token输出价格,最低2元与最高28元之间相差14倍

推动降价的有三股力。第一是技术效率,MoE架构让推理时显存占用降低约60%,吞吐量大幅提升,单位算力产出的Token更多。第二是市场竞争,DeepSeek、字节、腾讯贴身肉搏,谁也不敢在基础场景定高价。第三是普惠路线,厂商有意把入门场景价格压到极低,把开发者生态做大——先把人圈进来,再在高端场景把钱赚回来。

涨的那一端:价值定价开始收网

另一边,智谱在2026年第一季度把API定价上调了83%。GLM-5系列输出价格比GLM-4涨了50%,GLM-5.2旗舰输出28元/百万Token,在编程场景的缓存命中Token价格已经接近Anthropic Claude Sonnet(来源:人人都是产品经理,2026年8月)。

涨价没有吓跑客户。智谱第一季度Token消耗量同步增长了400%,出现供不应求。这说明一个转折:当模型能力强到能创造真实价值,定价逻辑从抢份额变成了为价值定价。能帮企业跑Agent、做长程编程的模型,客户愿意付溢价。

国内大模型价格与Benchmark综合对比表

图注:2026年6月国内主流大模型定价一览,涵盖阿里、腾讯、字节、DeepSeek、智谱、月之暗面等厂商

算力成本也在往上推。SemiAnalysis数据显示,英伟达H100一年期租赁价格从2025年10月的1.70美元/小时涨到2026年3月的2.35美元,涨幅近40%(来源:人人都是产品经理,2026年8月)。靠补贴换市场的半卖半送模式,在算力紧张的背景下越来越难撑。

不只是价格,Benchmark也在分化

价格分层的背后是能力分层。价格表附带的一份Benchmark对比,能看出各家把力气花在了不同地方。

DeepSeek V4-Pro在SWE-Verified拿到80.6,LiveCodeBench 93.5,编程能力第一梯队。字节Doubao-Seed-2.0-Pro在Terminal-Bench拿到71.0,Agent执行能力领先。智谱GLM-5.2的上下文窗口拉到1M,定位长程自主编程Agent。月之暗面Kimi K2.6在GPQA-D拿到90.5,科学推理突出。腾讯Hy3 Preview在BFCL-v3拿到78.3,工具调用强(来源:《国内大模型价格与Benchmark综合对比》全模型版,2026年6月)。

旗舰模型代码与Agent类Benchmark

图注:各家旗舰在编程、Agent执行、工具调用等维度的Benchmark对比

低价模型不是在所有维度都弱,高价模型也不是在所有维度都强。DeepSeek V4-Flash只要2元输出,SWE-Verified照样拿到79.0。贵,是因为在特定场景强,不是因为全面碾压。选模型的逻辑,正在从"谁最强"变成"谁在我最需要的那个维度上够强且够便宜"。

源势AI怎么看

我们给20多家企业做Token聚合和智能体落地,每天都在帮客户选模型。结论很朴素:没有最便宜的模型,只有最划算的组合。

一个典型场景:客户的Agent工作流里,System Prompt和知识库检索用DeepSeek V4-Flash,缓存命中0.02元;核心推理和代码生成切到GLM-5.2或Doubao-Seed-2.0-Pro;简单任务分流到Mini或免费模型。通过智能路由把不同任务分配给不同模型,整体降本30%到50%,这是我们实测的数据,不是理论值。

价格分裂对懂行的人是利好。模型越多、价差越大,路由策略的价值就越高。怕的是只盯单价不看用量——国家数据局数据显示中国日均Token调用量已突破140万亿,一个Agent任务动辄消耗数十万Token,单价再低乘以这个量也不便宜(来源:人人都是产品经理,2026年8月)。

管好Token账本,比选模型更能决定一个AI业务的成本底线。