同样一个DeepSeek V4模型,在官方API买是3元/百万Token,在聚合平台可能2元,在某个中转站可能1.5元。

同一个模型,价格差了一倍多。这不是打折促销,而是Token这门生意的供给结构本身就是分层的。

从模型原厂到终端用户,Token至少经历了五种不同的卖法。每种卖法的成本结构、利润空间和竞争壁垒完全不同。搞清楚这五层结构,才能在AI基础设施投资里避开坑。

模式一:原厂直营

最简单的链路。大模型厂商开放API,企业直接调用,按Token付费。

DeepSeek V4-Pro官方刊例价:输入3元/百万Token,输出6元/百万Token。通义千问Qwen3.5 Plus:输入0.8元,输出4.8元。

原厂直营的优势是SLA有保障、接口稳定。劣势是价格透明、没得谈。大客户可以走商务渠道拿折扣,但小客户只能按刊例价来。

对原厂来说,Token收入覆盖的是算卡、机房和训练团队的成本。这个模式的利润取决于模型能力和推理效率——同样的GPU,推理优化做得好,Token产量就高,单位成本就低。

模式二:云厂商全栈

阿里云百炼、火山引擎方舟、天翼云息壤、移动云MoMA——这些云厂商不只卖Token,而是打包提供"模型+算力+平台"的整套服务。

互联网云(阿里、火山)以自研模型为绝对主力,第三方模型只是补充。国资云(移动、天翼、联通)则反过来:引入DeepSeek、千问等开源模型,同时转售闭源模型。

商业模式分两段:云厂商对企业按Token收费,对模型原厂则区分开闭源——开源模型免费自部署不付费,闭源模型采购Token或按收入分成。

云厂商可以亏本卖Token,因为它背后有存储、数据库、网络等资源可以收钱。这是聚合平台做不到的。

模式三:聚合分发

OpenRouter和硅基流动是这一层的代表。一侧接入几百个模型,统一账单、智能路由、故障切换。

但中美两国的聚合平台走的是完全不同的路。

美国OpenRouter几乎是纯路由器。因为国外算力被英伟达芯片和CUDA生态高度标准化,只做转发和清算,在原厂Token费用之上浮5%。但它上个月选择寻求收购——月处理百万亿Token、增速500%的行业龙头,为什么想卖?因为纯路由的护城河太浅。

中国硅基流动做的活远多于路由。国内算力有华为昇腾、寒武纪等多芯并存,硅基流动做了大量跨芯片适配、推理引擎优化、异构算力调度。这些苦活累活反而构成了更深的护城河。

从硅基流动的招股书能看到一个关键数据:公有云MaaS业务收入占52.9%,毛利率是负119%;本地部署业务收入占47.1%,毛利率高达82.5%。

纯转卖Token不赚钱。赚钱的是围绕Token做的工程服务。

模式四:私有化部署

企业自建算力,把模型部署到自己的机房。数据完全不出域。

一台能跑70B级模型的8卡整机大约两百万元,加上数据工程和运维人力,每年成本在几十万级别。门槛不在软件在硬件。

这种模式适合金融、政务、医疗等数据敏感行业。成本结构完全不同于前三种——没有Token单价的概念,只有固定资产折旧和运维成本。

| 模式 | 典型玩家 | Token价格区间 | 核心壁垒 |

|------|---------|:---:|---------|

| 原厂直营 | DeepSeek/通义 | 刊例价 | 模型能力 |

| 云全栈 | 阿里百炼/天翼云 | 可打包 | 云生态绑定 |

| 聚合分发 | OpenRouter/硅基流动 | 接近原厂 | 工程效率 |

| 私有化 | 企业自建 | 无单价 | 数据合规 |

| 混合架构 | 大部分企业 | 加权 | 架构治理 |

*数据来源:KimKB笔记《Token运营:供给模式和商业模式总结》,2026年8月18日*

为什么同一个模型价格差这么多

表面上看是渠道问题,实际上至少有三个底层原因。

第一,具体规格不同。 同一个DeepSeek V4,128K上下文和1M上下文的价格不一样——长上下文需要更多KV Cache显存。FP8量化版和满血版的成本也不同。小Token工厂可能用低精度量化提升产量,价格更低但回答质量有差异。

第二,采购规模不同。 月消耗1亿Token和月消耗100亿Token的采购价折扣完全不同。大渠道商能拿到更低的批发价,薄利多销。

第三,调优能力不同。 同样的GPU和集群规模,缓存命中率做得好的供应商,大量重复请求走缓存,实际成本大幅下降;缓存做得差的每次从头推理,单价压不下来。P/D分离、KV-cache加速等优化也直接影响Token产出效率。

混合架构是现实选择

大部分企业最终会选模式五:混合架构。敏感数据走本地模型,通用任务走公有API,中间一层统一AI网关做调度、脱敏和记账。

这种方式的代价是架构复杂度。你得同时管理本地推理集群和多个公有API,处理模型切换、故障转移、用量分账等问题。

源势AI观点

Token生意的本质不是卖算力,而是卖效率差。

原厂卖的是模型能力和推理效率。云厂商卖的是生态绑定和交叉补贴。聚合平台卖的是路由优化和异构适配。私有化卖的是数据合规。每一层都有自己的利润来源,但纯转卖Token的中间商没有未来——硅基流动的毛利率数据已经很清楚了。

对采购方来说,最重要的不是找最便宜的Token单价,而是算清楚TCO(总拥有成本)。一个看起来便宜的Token,如果上下文被截断、缓存命中率低、SLA无保障,实际成本可能更高。

对供给方来说,胜负手在离客户场景的距离。模型能力趋同的情况下,谁能更快响应行业需求、谁能在特定场景做出调优差异,谁就有定价权。

---

来源标注

1. KimKB笔记《Token运营:供给模式和商业模式总结》(公众号"大嘴阿杂",呼噜姐姐,2026年8月9日)

2. 《揭秘:相同模型在不同渠道Token价格差异的3点原因》(公众号"老张IT智习社",2026年8月15日)

3. 硅基流动招股书数据,2026年