DATA / WALL12 SEP 2026
数据墙之后,
性能开始用算力买
前面几篇讨论过资本开支流向哪一层、模型有没有护城河。这一篇要处理一个更靠前的问题:驱动这一切的原料,供给端正在发生什么。
当免费的原料快用完,工厂并不会停工。它会改用一种更贵的原料,然后告诉你产量还在涨。
SUPPLY 01 公开语料接近上限 |
SHIFT 02 转向推理时计算 |
SLOPE 03 成本斜率仍未知 |
中心判断:
可公开获取的高质量文本正在接近上限,预训练这条增长路径的供给侧开始封顶。
于是前沿的做法转向用推理时的大规模计算去换性能——这条路走得通,但它的成本曲线和过去那条完全不同。
DATA / 01
一、先把一个流传很广的数字说清楚
关于"中文语料到底有多少",市面上至少同时流传三个数字,而且经常被混着用。它们分别是:
这三个口径量级差了三倍以上,互相不能替换。
我自己回原始来源核了一遍。按网站个数的实时统计,中文占约 1.3%;按目前规模最大的公开网页抓取库的月度快照,中文占约 4.4%。两个数都对,因为它们数的根本不是同一样东西——前者一个三页的企业官网和一个百万帖的论坛权重相同。
顺带纠正一句正在传播的说法:同一张榜单上,阿拉伯语的占比只有中文的一半左右;在抓取库口径下差距更大。"中文还不如阿拉伯语"这句话,在两个口径下都不成立。
我花力气写这一段,不是为了纠正一个无关紧要的错误。 而是因为——一个真问题如果被一个错数字带着传播,等错数字被拆穿时,真问题会被一起丢掉。
真问题是:无论用哪个口径,中文可用于训练的公开语料都显著偏少,而且这不是中文独有的困境,只是中文更严重。
DATA / 02
二、墙是真的,而且已经不是预测
把几方口径放在一起看:
| 来源 | 判断 |
| 独立研究机构测算 | 全球高质量、公开可得的人类文本存量可能在数年内耗尽 |
| 一位知名研究者的公开警告 | 本十年结束前,训练就会撞上"数据墙" |
| 国内官方研究机构 | 互联网公域数据几乎消耗殆尽,预训练已经撞墙 |
| 国家层面 | 已启动面向 2028 年的国家级训练数据集建设计划 |
当主管部门开始把数据当基础设施来组织,说明它已经不被当作一个技术问题了。
中文世界还有一重特殊困难:大量优质内容并不在公域。 深度行业分析、真实经验、高质量问答,沉淀在各个超级应用内部,对外不可抓取。同时出版方开始在版权页加印"禁止用于训练"。
所以中文语料的问题不是"没有",是"抓不到"。 这个区别很重要——存量问题只能靠时间,可及性问题取决于商业与法律安排,理论上可变,但需要有人让渡利益。
DATA / 03
三、供给封顶之后,性能从哪来
这才是本篇真正关心的地方。
过去几年那条朴素经验是:更多数据 + 更大算力 = 更强模型。 当第一项开始封顶,这条经验就只剩一半。
于是出现了另一条路径:不再靠更多数据,而是在解题时投入极大规模的并行计算。
今年有一个被广泛报道的例子:为攻克一个著名的数学难题,某个前沿模型动用了约一万个并行智能体、持续运行了约八十八小时,智能体之间交换了数百万条消息,产出了千亿量级的 token,之后还用了十七个小时做形式化验证。
这件事被普遍解读为"模型变聪明了"。我认为这个解读需要修正。
它更接近于:用极大规模的并行搜索,把一次成功的概率堆上去。
DATA / 04
四、两个方向相反的推论,必须同时记住
推论一(对算力有利):如果性能增量越来越依赖推理时的计算,那么推理侧的算力需求就不是可选项,而是被迫项。
这一条如果成立,含义比"AI 很火所以买算力"强得多:它意味着算力需求的增长是结构性的,不是情绪性的。因为它不来自热情,来自另一条路被堵死。
推论二(对成本不利):同一件事说明,单位成功任务的成本在上升,不是下降。
一万个智能体跑八十八小时,换来一个结果。这条成本曲线与过去"模型迭代所以变便宜"的曲线,是两回事。
这两个推论指向相反的方向,而且都从同一个事实推出来。 只取其中一个来支持自己已有的立场,是这类材料最容易被误用的方式。
我自己的处理是:两条都记下来,然后承认我缺少判定谁更强的那个数。
DATA / 05
五、这个判断可能错在哪
第一,那些算力数字来自当事方自己的发布,没有第三方复核。 而且这类数字存在明显的宣传动机。我在正文里刻意只用了量级。
第二,合成数据可能把墙推远。 这是对本文最直接的反驳,而且已经有现实支撑:若干模型靠翻译数据、合成数据和多语言迁移,在语料劣势下仍达到了同梯队水平。如果稀缺可以被绕过,那么"墙"就只是一个减速带。
第三,但合成数据也有上限。 一项发表在顶级期刊的研究显示,模型持续用递归生成的数据训练会出现不可逆的退化,逐渐遗忘真实分布的尾部。第二条和第三条必须成对读,它们互相对冲,净效应我判断不了。
第四,也是最关键的缺口:我没有两条成本曲线的斜率对比。 推理时计算换来的性能,其边际成本相对于过去预训练路径的边际成本,究竟是高一个量级还是低一个量级?拿不到这个数,本文第四节的两个推论就都只是假说。
DATA / 06
六、可以跟踪的三个信号
—推理算力支出占总算力支出的比重。如果这个比重持续上升,第四节推论一得到支持。—前沿模型发布时是否披露"达成该结果所消耗的计算量"。目前这类披露是选择性的、宣传性的;当它变成常规披露项时,成本曲线才可比。—公开语料替代方案的实际进展:国家级数据集的开放范围、行业数据的流通机制是否真正落地。
第二个最重要,也最不可能自愿发生——因为它会同时暴露能力和成本。
DATA / 07
七、本文的置信度分层
| 层级 | 内容 | 可靠性 |
| 统计事实 | 三个语料口径的具体数值 | 我已回原始来源独立复核 |
| 机构判断 | 公开文本数年内耗尽、公域已近枯竭 | 多方独立口径一致 |
| 政策事实 | 国家级数据集计划已启动 | 公开信息 |
| 事件描述 | 大规模并行搜索攻克难题所耗资源 | 当事方自述,无第三方复核 |
| 学术证据 | 递归使用生成数据导致模型退化 | 同行评审论文 |
| 推断 | 供给封顶 → 转向推理时计算 | 本文核心,属假说 |
| 最大缺口 | 两条路径的成本斜率对比 | 未获得,结论因此悬空 |
本系列写到这里,我越来越确信一件事:AI 相关的判断,错误往往不发生在"看多还是看空",而发生在"用同一个事实只推出自己想要的那一半"。 第四节那两个相反的推论,是我目前最不愿意让读者只记住一条的地方。
方法说明:本文讨论行业层面的供给约束与技术路径变化,语料统计数值经作者回原始来源核对,事件类数字为当事方自述,已在第七节分层标明。不评价任何具体公司,不涉及估值、仓位或买卖判断。不构成投资建议。