← 半导体与AI投资目录

半导体与AI投资 16|先问验证器从哪来,多贵

VERIFY / BOUNDARY12 SEP 2026

先问验证器从哪来,
多贵

第十三篇说过,在软件开发里瓶颈已经从"写代码"转到"验证代码"。那一篇讲的是一个领域内部的瓶颈迁移。这一篇讲的是另一件事:为什么同样的方法在有些领域能兑现,在另一些领域连试都试不了。

一个能力演示要变成一门生意,中间隔着一个问题:谁来确认它做对了,以及那个确认要花多少钱。

JUDGE

01

裁判是谁

PRICE

02

一次判定多少钱

SCOPE

03

决定能不能外推

中心判断:

用大规模计算暴力换性能,只在存在廉价自动验证器的领域有效。

验证器的成本,决定了一次能力演示能不能外推成一门生意。

VERIFY / 01

一、被忽略的那十七个小时

上一篇提到过那个例子:约一万个智能体、八十八小时、千亿量级 token,攻克一个著名数学难题。

几乎所有报道都在讲前面那串数字,很少有人提后面那一句:之后还用了十七个小时做形式化验证。

那十七个小时才是关键。

形式化验证的意思是:把证明写成机器可以逐步检查的形式,由程序判定它对不对。这个判定不需要人类专家、不需要几个月、不会累、不会给面子。

换句话说:这套暴力搜索之所以能用,前提是有一个又快又便宜又不会撒谎的裁判。

搜索本身产出的是大量候选,其中绝大多数是错的。没有裁判,一万个智能体生产的就不是答案,是一万份需要人类去审的垃圾。

VERIFY / 02

二、把领域按裁判的价格排一下

这就得到了一把筛子。面对任何"AI 攻克了 X"的消息,先别问模型多强,先问:这个领域的裁判是谁,一次判定多少钱。

领域裁判是谁一次判定的成本
形式化数学证明检查程序极低,可无限次运行
软件工程编译器、测试、线上指标低,但测试本身要人写
棋类与游戏规则本身接近零
医疗诊断病理结果、长期随访极高,且滞后数月到数年
法律意见判决、执行结果极高,滞后数年,且不可重放
战略决策若干年后的经营结果无法归因,样本量为一

上半张表和下半张表,不是同一个生意。

上半张表里,算力可以直接换成结果,因为失败是免费的——生成一万个错答案不要紧,裁判会瞬间筛掉。

下半张表里,失败不免费,而且往往在很久以后才知道自己失败了。 在这类领域,增加生成量不改善结果,只增加需要人类审核的数量。算力在这里不是杠杆,是负担。

VERIFY / 03

三、这把筛子怎么用在生意上

它可以直接翻译成两个商业问题。

第一,这块收入落在表的上半还是下半。 上半部分的 AI 收入更容易兑现、更容易续订,因为客户能自己验证价值;下半部分的收入更依赖信任和叙事,也更容易在第一次事故后整体蒸发。

第二,如果落在下半,那么谁来承担验证成本。 这笔成本不会消失,它只会在供应商、客户和保险之间转移。一家公司如果把验证成本留给客户,它的增长会比同行快,续订会比同行差。

我认为这是目前区分"AI 收入"质量最实用的一条线,比区分"模型层还是应用层"更管用。

VERIFY / 04

四、指标变成目标之后

今年有二十五位数学界最高奖项的得主发表了一份联合声明。他们的核心指控不是"AI 不该做数学",而是:

把"解决了多少著名难题、多快解决"当作"概念理解与洞见"的能力指标。

一旦指标本身变成目标,工具就会开始伤害目标。

他们的担忧具体而不抽象:一个重大问题被解决,过去意味着有了新方法、新视角,此后共同体要花很多年把它变成别人能理解和使用的知识。答案不是终点,答案如何进入已有知识体系才是。 而当结果被批量、快速地抛出来,这个消化过程就被跳过了。

这件事对投资的意义,不在于道德判断,在于它提示了一种系统性的读数偏差:

可被快速量化的指标,会挤掉难以量化但更重要的指标——不是因为有人作弊,而是因为前者能进 PPT。

我在自己的判断里也犯过同一类错误。能算出来的东西天然占据注意力,哪怕它不是那个决定性的东西。

VERIFY / 05

五、还有一个时间尺度的错位

同一份材料里有个容易被略过的事实:那个奖项设立二十多年来,七道大奖难题中,被官方正式确认解决的至今只有一道。

权威确认的周期以年计,公司发布的周期以周计。

这两个时钟的差,本身就是一条可用的判读规则:

"某公司宣布解决"和"该领域确认解决",是两个不同强度的事实。 前者由发布方定义,后者由第三方定义。默认按前者处理。

这条规则不针对任何一家公司。它针对的是我们自己的接收方式——我们习惯用报道的密度来估计进展的速度,而报道密度由发布节奏决定,不由验证节奏决定。

VERIFY / 06

六、这个判断可能错在哪

第一,最重要的一条:验证器本身可能被造出来。 如果模型能为低可验证领域自动生成足够好的评判标准(自动化测试、可复现的评估流程、模拟环境),那么下半张表会逐步向上半张表迁移。这是我最无法排除的反证,也是最值得跟踪的方向。

第二,"廉价验证器"和"正确验证器"不是一回事。 软件领域的测试很便宜,但测试本身可能是错的、覆盖不全的。便宜的裁判会带来另一种失败:大量通过测试但方向错误的产出。

第三,本文的表格是我按常识排的,不是测量出来的。 每个领域"一次判定的成本"我没有量化依据,只有量级直觉。这是本文最弱的一环。

第四,下半张表未必没有生意。 在验证昂贵的领域,AI 也可以只做辅助与初筛,把最终判定留给人。这类生意的天花板更低,但未必不成立——本文的筛子会低估它们。

VERIFY / 07

七、可以跟踪的三个信号

企业采购时是否为"可验证性"单独付费:审计日志、可复现记录、责任界定条款是否进入合同正文。
低可验证领域是否出现被广泛接受的第三方评估标准:这是第六节反证一兑现的第一个迹象。
事故之后的续订率:这是检验"下半张表的收入更脆弱"这个判断最直接的数据,可惜通常不披露。

VERIFY / 08

八、本文的置信度分层

层级内容可靠性
技术事实大规模搜索依赖形式化验证收尾公开报道,多源一致
一手声明二十五位得主的联合声明及其指控声明原文可查
事实对比大奖难题官方确认数量与周期公开事实
结构判断验证器成本决定可外推性本文核心,逻辑推演
领域分级表各领域判定成本高低常识排序,无量化依据
最大反证验证器本身可能被自动生成无法排除
 

这一篇和第十三篇是一对。 第十三篇说"验证正在变成价值高地",这一篇说"验证成本决定了哪些领域根本进不去"。如果只能记住一句,我希望是这句:看到一个惊人的能力演示,先找裁判在哪。

 
 

方法说明:本文讨论能力演示向商业价值转化的边界条件,领域分级为作者常识排序、无量化依据,已在第八节标明。不评价任何具体公司,不涉及估值、仓位或买卖判断。不构成投资建议。