2023年3月GPT-4发布时,每百万Token输入价格30美元、输出60美元。三年后同等智能水平的价格下降超过95%。按常识,AI开支应该收缩。现实恰恰相反:2026年3月,中国日均Token调用量突破140万亿,较2024年初增长超过千倍。

价格越降,用量越涨,总账单不降反升。经济学里这个现象叫杰文斯悖论:蒸汽机效率越高、单位耗煤越低,煤炭总消耗反而越大。

降价反而催量

首席商业评论的文章梳理了这组数据。2026年3月全球单周Token调用量达20.4万亿,中国日均调用量突破140万亿。价格下降一个数量级,总消耗可能上升两个数量级。

原因在于需求结构的改变。价格足够低之后,大量原本不具备经济性的任务开始被纳入AI处理范围。企业月度支出从5万美元涨到50万美元,但完成的任务量是此前的十倍以上。

更关键的变量是使用范式的迁移。对话式交互以人的时间为上限,Agent可以24小时运行。一个员工背后可能挂着10个Agent,用量可达纯人工交互的数十倍。有研究显示,智能体编程任务的Token消耗约为普通问答的一千倍。

Token杰文斯悖论数据

图:Token价格暴跌与调用量暴涨的对比数据

AI产业链利润分配

图:芯片层拿走近八成毛利,应用层毛利仅0-30%

Fortune在8月7日报道了Uber的案例:Uber在几个月内花完了整个2026年的AI预算。CTO承认,即使通过策略降低了单位Token成本,Jevons悖论的风险依然存在——Token越便宜,消耗增长越快,总成本反而更高。

利润往上走,不往下走

成本在产业链中的分配同样值得注意。以每月20美元的Claude订阅为例,模型公司扣除算力、渠道和运营成本后净利空间很薄。而流向芯片层的利润有时不比模型公司少。

按产业栈拆分,生成式AI生态年化收入约4000亿美元时,芯片层拿走约七成收入和近八成毛利。应用层收入约600亿美元,毛利率多在0到30%之间。英伟达一类的芯片公司毛利率可达七成。云计算时代应用层占据最大份额的正三角形,在AI产业中倒置了。

模型层内部也在分化。偏企业API、依靠存量客户用量滚雪球的公司,推理毛利率从深度亏损修复到七成上下。而背负庞大免费用户的公司,营业表现远不如收入标题好看。

从省单价到省任务

面对账单压力,行业开始从省单价转向省任务。

具体做法包括:简单任务路由至小模型,为Agent设置任务预算防止空转,核算单位从每百万Token价格转为完成一件事的总成本。实践表明,使用同样的模型和用量,具备任务拆解、结果验证和流程接入能力的公司产出效率更高。

补贴模式也在退潮。Claude Code退出低价订阅,Copilot改为按量计费。Anthropic的年化收入从2024年12月的约10亿美元增长到2026年5月的470亿美元以上,一年半增长超四十倍。但OpenAI在2025年11月的内部文件中,将自由现金流转正时点推迟到约2030年。同处AI产业,两类公司的增长已经分化。

源势AI怎么看

我们的Token聚合平台接了20多个模型,智能路由是核心能力。路由降本30%到50%不是靠谈判压价,靠的是任务级路由——简单任务走小模型,复杂任务走大模型,每类任务匹配性价比最高的模型。

杰文斯悖论在我们客户身上真实存在。一个金融客户接入平台后,单位Token成本降了40%,但三个月后总账单反而涨了30%。原因是他们把更多原来人工处理的任务交给了Agent。这不是坏事——他们完成的业务量翻了倍。

但这也说明一个道理:只优化单价是不够的。我们帮客户做的不是压Token价格,是优化任务结构。哪些步骤可以用规则替代,哪些可以用缓存,哪些需要模型推理。把任务拆解清楚,再匹配模型,总成本才能控制住。Token越便宜的时代,省的思路不是少用,是用得对。