← 半导体与AI投资目录

半导体与AI投资 15|数据墙之后,性能开始用算力买

DATA / WALL12 SEP 2026

数据墙之后,
性能开始用算力买

前面几篇讨论过资本开支流向哪一层、模型有没有护城河。这一篇要处理一个更靠前的问题:驱动这一切的原料,供给端正在发生什么。

当免费的原料快用完,工厂并不会停工。它会改用一种更贵的原料,然后告诉你产量还在涨。

SUPPLY

01

公开语料接近上限

SHIFT

02

转向推理时计算

SLOPE

03

成本斜率仍未知

中心判断:

可公开获取的高质量文本正在接近上限,预训练这条增长路径的供给侧开始封顶。

于是前沿的做法转向用推理时的大规模计算去换性能——这条路走得通,但它的成本曲线和过去那条完全不同。

DATA / 01

一、先把一个流传很广的数字说清楚

关于"中文语料到底有多少",市面上至少同时流传三个数字,而且经常被混着用。它们分别是:

按网站个数统计的语言占比;
按公开抓取到的网页统计的语言占比;
若干年前某个特定训练集里的语言占比。

这三个口径量级差了三倍以上,互相不能替换

我自己回原始来源核了一遍。按网站个数的实时统计,中文占约 1.3%;按目前规模最大的公开网页抓取库的月度快照,中文占约 4.4%。两个数都对,因为它们数的根本不是同一样东西——前者一个三页的企业官网和一个百万帖的论坛权重相同。

顺带纠正一句正在传播的说法:同一张榜单上,阿拉伯语的占比只有中文的一半左右;在抓取库口径下差距更大。"中文还不如阿拉伯语"这句话,在两个口径下都不成立。

我花力气写这一段,不是为了纠正一个无关紧要的错误。 而是因为——一个真问题如果被一个错数字带着传播,等错数字被拆穿时,真问题会被一起丢掉。

真问题是:无论用哪个口径,中文可用于训练的公开语料都显著偏少,而且这不是中文独有的困境,只是中文更严重。

DATA / 02

二、墙是真的,而且已经不是预测

把几方口径放在一起看:

来源判断
独立研究机构测算全球高质量、公开可得的人类文本存量可能在数年内耗尽
一位知名研究者的公开警告本十年结束前,训练就会撞上"数据墙"
国内官方研究机构互联网公域数据几乎消耗殆尽,预训练已经撞墙
国家层面已启动面向 2028 年的国家级训练数据集建设计划

当主管部门开始把数据当基础设施来组织,说明它已经不被当作一个技术问题了。

中文世界还有一重特殊困难:大量优质内容并不在公域。 深度行业分析、真实经验、高质量问答,沉淀在各个超级应用内部,对外不可抓取。同时出版方开始在版权页加印"禁止用于训练"。

所以中文语料的问题不是"没有",是"抓不到"。 这个区别很重要——存量问题只能靠时间,可及性问题取决于商业与法律安排,理论上可变,但需要有人让渡利益。

DATA / 03

三、供给封顶之后,性能从哪来

这才是本篇真正关心的地方。

过去几年那条朴素经验是:更多数据 + 更大算力 = 更强模型。 当第一项开始封顶,这条经验就只剩一半。

于是出现了另一条路径:不再靠更多数据,而是在解题时投入极大规模的并行计算。

今年有一个被广泛报道的例子:为攻克一个著名的数学难题,某个前沿模型动用了约一万个并行智能体、持续运行了约八十八小时,智能体之间交换了数百万条消息,产出了千亿量级的 token,之后还用了十七个小时做形式化验证。

这件事被普遍解读为"模型变聪明了"。我认为这个解读需要修正。

它更接近于:用极大规模的并行搜索,把一次成功的概率堆上去。

DATA / 04

四、两个方向相反的推论,必须同时记住

推论一(对算力有利):如果性能增量越来越依赖推理时的计算,那么推理侧的算力需求就不是可选项,而是被迫项。

这一条如果成立,含义比"AI 很火所以买算力"强得多:它意味着算力需求的增长是结构性的,不是情绪性的。因为它不来自热情,来自另一条路被堵死。

推论二(对成本不利):同一件事说明,单位成功任务的成本在上升,不是下降。

一万个智能体跑八十八小时,换来一个结果。这条成本曲线与过去"模型迭代所以变便宜"的曲线,是两回事。

这两个推论指向相反的方向,而且都从同一个事实推出来。 只取其中一个来支持自己已有的立场,是这类材料最容易被误用的方式。

我自己的处理是:两条都记下来,然后承认我缺少判定谁更强的那个数。

DATA / 05

五、这个判断可能错在哪

第一,那些算力数字来自当事方自己的发布,没有第三方复核。 而且这类数字存在明显的宣传动机。我在正文里刻意只用了量级。

第二,合成数据可能把墙推远。 这是对本文最直接的反驳,而且已经有现实支撑:若干模型靠翻译数据、合成数据和多语言迁移,在语料劣势下仍达到了同梯队水平。如果稀缺可以被绕过,那么"墙"就只是一个减速带。

第三,但合成数据也有上限。 一项发表在顶级期刊的研究显示,模型持续用递归生成的数据训练会出现不可逆的退化,逐渐遗忘真实分布的尾部。第二条和第三条必须成对读,它们互相对冲,净效应我判断不了。

第四,也是最关键的缺口:我没有两条成本曲线的斜率对比。 推理时计算换来的性能,其边际成本相对于过去预训练路径的边际成本,究竟是高一个量级还是低一个量级?拿不到这个数,本文第四节的两个推论就都只是假说。

DATA / 06

六、可以跟踪的三个信号

推理算力支出占总算力支出的比重。如果这个比重持续上升,第四节推论一得到支持。
前沿模型发布时是否披露"达成该结果所消耗的计算量"。目前这类披露是选择性的、宣传性的;当它变成常规披露项时,成本曲线才可比。
公开语料替代方案的实际进展:国家级数据集的开放范围、行业数据的流通机制是否真正落地。

第二个最重要,也最不可能自愿发生——因为它会同时暴露能力和成本。

DATA / 07

七、本文的置信度分层

层级内容可靠性
统计事实三个语料口径的具体数值我已回原始来源独立复核
机构判断公开文本数年内耗尽、公域已近枯竭多方独立口径一致
政策事实国家级数据集计划已启动公开信息
事件描述大规模并行搜索攻克难题所耗资源当事方自述,无第三方复核
学术证据递归使用生成数据导致模型退化同行评审论文
推断供给封顶 → 转向推理时计算本文核心,属假说
最大缺口两条路径的成本斜率对比未获得,结论因此悬空
 

本系列写到这里,我越来越确信一件事:AI 相关的判断,错误往往不发生在"看多还是看空",而发生在"用同一个事实只推出自己想要的那一半"。 第四节那两个相反的推论,是我目前最不愿意让读者只记住一条的地方。

 
 

方法说明:本文讨论行业层面的供给约束与技术路径变化,语料统计数值经作者回原始来源核对,事件类数字为当事方自述,已在第七节分层标明。不评价任何具体公司,不涉及估值、仓位或买卖判断。不构成投资建议。