过去十年,AI 基础设施的竞争焦点是芯片。谁的卡算力强,谁赢。现在卡的数量已经够多了,瓶颈正在从单卡转移到卡与卡之间的连接上。
阿里云 8 月 12 日上线灵骏真武 M890 超节点时,自己给出的判断是:在超大规模集群里,决定性能上限的不是计算单元,而是连接它们的网络。
这句话值得停下来想。
一个超节点是一台机器
先看 M890 的结构(来源:SDNLAB 公众号 2026 年 8 月技术解析)。
这个产品拆开是三样东西。真武 M890 芯片,单卡 144GB HBM 显存,训练场景性能是上一代 810E 的三倍。互联芯片 ICN Switch 1.0,把卡间互联规模从 16 卡拉到 64 卡,卡间带宽 800GB/s,点对点时延压到 150 纳秒以内,单颗吞吐 25.6Tbps。网络底座 HPN 8.0,把超节点连成集群,单集群最高支持 13 万张卡异构混布(SDNLAB 口径,公开报道亦有 12.2 万卡的说法,口径取整不同)。
关键在中间那层。64 张卡被捏成一台逻辑机器,Scale-up 域总带宽 51.2TB/s。万亿参数模型装不进任何单张卡,必须拆开让几十上百张卡协同计算。协同就要频繁交换数据,通信慢一步,整个集群空转一步。
图注:灵骏真武 M890 超节点(图源:SDNLAB 公众号,2026-08-14)
阿里云已经跑通超 2 万亿参数的大模型在这个单元上,Kimi K3 和 Qwen3.8-Max 都在上面对外提供服务。
两张网,必须分开
理解这类架构要分清两张网。
Scale-up 解决机柜内的问题:极致带宽、纳秒级时延,因为梯度同步、专家并行的 All-to-All 通信都发生在这个尺度。Scale-out 解决机柜间的问题:万卡到十万卡规模,要的是弹性和大规模流量调度。
一张网没法同时满足两种需求。混在一起,要么牺牲规模换速度,要么牺牲速度换规模。英伟达的做法一样:NVLink 加 NVSwitch 管机柜内,Spectrum-X 管机柜间。
这背后还有个老问题。传统数据中心网络用哈希分配流量,前提是流量多且乱。大模型训练的流量恰好相反:连接少、单个流量巨大、周期性突发,哈希容易把多条大象流压到同一条链路。阿里云在 2024 年 SIGCOMM 论文里就报告过这个问题,当时的双平面架构把端到端训练性能提升了 14.9%。
连接问题的根源在协议
连接为什么这么难?答案藏在更底层的协议设计里。
CXL 规范首席架构师 Debendra Das Sharma 等人在综述论文(arXiv:2306.11227)里给过一个决定性对比:x16 Gen5 PCIe 端口用 64 根信号引脚提供 64 GB/s 单向带宽;DDR5-6400 用约 200 根引脚只提供 50 GB/s。PCIe 每引脚带宽比 DDR 高约 8 倍。
也就是说,不是带宽造不出来,是内存和互连两套协议各管一段,资源被物理绑定在单台服务器上。论文把这叫资源滞留(stranding):算力跑满的服务器内存闲置,内存吃紧的服务器借不到资源。CXL 协议从 1.0 演进到 3.0,做的事情就是拆掉这堵墙——从单机内的一致性访问,到内存池化,再到 4096 端点的多级互联。
图注:超节点内部 64 卡高速互联,向外再接入集群级网络
这和 M890 的产品逻辑是同一条线:单机内的连接用专用互联做极致,跨机的连接用网络做规模,中间的协议边界决定了架构边界。
图注:真武 M890 超节点的关键互联指标,全部来自 SDNLAB 技术解析
源势AI怎么看
连接成为瓶颈,对两类玩家意味着完全不同的事。
对云厂商,这是重资产竞赛的入场券。M890 这类超节点,从芯片到互联协议到通信库全栈自研,门槛极高,能参与的玩家不超过个位数。
对企业用户,结论正好相反:不要自己碰这一层。训练大模型的团队才需要关心卡间时延是 150 纳秒还是 200 纳秒;绝大多数企业的推理需求,通过聚合平台调用就够了。
我们的判断是:连接层的军备竞赛会把推理单价继续往下压。集群效率每提升一档,Token 成本就降一档。企业该做的是在价格传导链的末端占好位置——选一个能把基础设施红利真实传导到账单上的服务商。
源势AI Token 聚合平台接入 20+ 主流模型,企业级 SLA 99.95%+,智能路由帮企业降本 30% 到 50%。上游打得再热闹,企业的账本只认单价和稳定性。