SEMICONDUCTOR / AI INVESTING14 SEP 2026
八十倍的墙
稀缺在连线,不在内存
模型装不下,再加一台机器不就行了?这个直觉在家里和在数据中心一样常见,也一样错。要看清它错在哪,得先看清生成一个字的物理过程。
芯片内搬数据每秒八百多 G,机器之间最快的通用连线每秒十 G 量级——差约八十倍。这道墙决定了堆机器只买得到容量、买不到速度,也决定了 AI 硬件的定价权在哪一层。
BANDWIDTH 01 速度=带宽÷每字搬运量 |
WALL 02 跨机连线慢约八十倍 |
PRICING 03 绕不开的互联才有定价权 |
SEMICONDUCTOR / 01
写字的物理学
大模型生成一个 token,本质是把这一步用到的参数从内存里完整搬运一遍。所以生成速度有一个干净的算式:速度上限 = 内存带宽 ÷ 每字搬运量。
一台统一内存带宽约 819GB/s 的工作站,跑一个七千五百亿参数、每字实际动用四百亿参数的模型:每字约搬 22G,理论上限约每秒 37 个 token,实测 19 个——实测通常是理论值的三到五成,其余耗在注意力等开销上。同一台机器换一个每字只动用一百八十亿参数的模型,上限升到约 80,实测 28;换一个 40 亿的小模型,实测 185。
注意:决定速度的不是模型总共多大,是每个字动用多少。这正是「每字只唤醒一小撮专家」的稀疏架构统治大模型的原因——它是这道算式下唯一的省钱方向。
SEMICONDUCTOR / 02
跨机的墙
现在把模型切开放到两台机器上:前一半层在 A 机,后一半在 B 机,每个字先在 A 算完,把中间结果传给 B。数据量不大,但每个字都要跨一次机器。
机器之间最快的通用连线,带宽在每秒 10G 量级——和芯片内的 819G 差约八十倍,还要加上每次往返的延迟。芯片内那条搬运线像工厂里的传送带,机器之间的连线像两个厂区之间的公路:写一篇几百字的回答,就是几百次穿厂区的来回。直连内存的新技术能把延迟压低不少,但改不了带宽的量级。实测和原理给出同一个结论:多机合装,只解决「装得下」,每个字通常比单机更慢。 这就是转向:加机器换来的是容量,交出去的是速度——稀缺不在内存,在连线。
顺带一笔账:用几台小内存机器给大工作站「凑内存」,凑出的余量往往跨不到下一档模型,却先把速度交了出去。合装要有意义,得是两台同级大机直连——按内存算约能装下更大一档的模型,但这是估算,没有实机验证,而且「更慢」这一条不变。
SEMICONDUCTOR / 03
数据中心里的同一道墙
把场景放大一千倍,这道墙就是 AI 硬件竞争的地形图。
高速互联方案的溢价、「先把一台机器做大,再考虑堆很多台」的架构顺序、机柜级产品把几十颗芯片连成一个整体的设计——根源全是同一道算式:芯片内和芯片间的带宽差着数量级,所以谁能把这个差距缩小,谁就坐在绕不开的位置上。墙在哪,钱就花在哪。
内存容量是入场费:高带宽内存很贵,但出钱都买得到。把上千颗芯片连成「一台机器」的互联,才是定价权所在——判据很简单:客户绕开它,要付出什么。 绕开一家内存供应商,付的是价格;绕开一套互联体系,付的是整个集群的架构重来。看 AI 硬件公司时,把它的收入按「容量生意」和「连线生意」拆开看,结论常常和整体印象不同。
SEMICONDUCTOR / 04
这个判断什么时候失效
三个方向都有明确的失效条件。一,互联带宽出现数量级跃升——比如硅光互联成熟,墙变矮,互联溢价随之压缩,这是可观测的;二,模型小型化快于模型膨胀,主流模型单机装得下,「装得下」不再构成问题,连线的稀缺性同步下降;三,推理走向大批量吞吐、延迟被摊薄的场景,跨机的代价被批量掩盖,多机方案的劣势缩小。三条里任何一条成真,本文的「稀缺在连线」都要按比例打折。