VERIFY / BOUNDARY12 SEP 2026
先问验证器从哪来,
多贵
第十三篇说过,在软件开发里瓶颈已经从"写代码"转到"验证代码"。那一篇讲的是一个领域内部的瓶颈迁移。这一篇讲的是另一件事:为什么同样的方法在有些领域能兑现,在另一些领域连试都试不了。
一个能力演示要变成一门生意,中间隔着一个问题:谁来确认它做对了,以及那个确认要花多少钱。
JUDGE 01 裁判是谁 |
PRICE 02 一次判定多少钱 |
SCOPE 03 决定能不能外推 |
中心判断:
用大规模计算暴力换性能,只在存在廉价自动验证器的领域有效。
验证器的成本,决定了一次能力演示能不能外推成一门生意。
VERIFY / 01
一、被忽略的那十七个小时
上一篇提到过那个例子:约一万个智能体、八十八小时、千亿量级 token,攻克一个著名数学难题。
几乎所有报道都在讲前面那串数字,很少有人提后面那一句:之后还用了十七个小时做形式化验证。
那十七个小时才是关键。
形式化验证的意思是:把证明写成机器可以逐步检查的形式,由程序判定它对不对。这个判定不需要人类专家、不需要几个月、不会累、不会给面子。
换句话说:这套暴力搜索之所以能用,前提是有一个又快又便宜又不会撒谎的裁判。
搜索本身产出的是大量候选,其中绝大多数是错的。没有裁判,一万个智能体生产的就不是答案,是一万份需要人类去审的垃圾。
VERIFY / 02
二、把领域按裁判的价格排一下
这就得到了一把筛子。面对任何"AI 攻克了 X"的消息,先别问模型多强,先问:这个领域的裁判是谁,一次判定多少钱。
| 领域 | 裁判是谁 | 一次判定的成本 |
| 形式化数学 | 证明检查程序 | 极低,可无限次运行 |
| 软件工程 | 编译器、测试、线上指标 | 低,但测试本身要人写 |
| 棋类与游戏 | 规则本身 | 接近零 |
| 医疗诊断 | 病理结果、长期随访 | 极高,且滞后数月到数年 |
| 法律意见 | 判决、执行结果 | 极高,滞后数年,且不可重放 |
| 战略决策 | 若干年后的经营结果 | 无法归因,样本量为一 |
上半张表和下半张表,不是同一个生意。
上半张表里,算力可以直接换成结果,因为失败是免费的——生成一万个错答案不要紧,裁判会瞬间筛掉。
下半张表里,失败不免费,而且往往在很久以后才知道自己失败了。 在这类领域,增加生成量不改善结果,只增加需要人类审核的数量。算力在这里不是杠杆,是负担。
VERIFY / 03
三、这把筛子怎么用在生意上
它可以直接翻译成两个商业问题。
第一,这块收入落在表的上半还是下半。 上半部分的 AI 收入更容易兑现、更容易续订,因为客户能自己验证价值;下半部分的收入更依赖信任和叙事,也更容易在第一次事故后整体蒸发。
第二,如果落在下半,那么谁来承担验证成本。 这笔成本不会消失,它只会在供应商、客户和保险之间转移。一家公司如果把验证成本留给客户,它的增长会比同行快,续订会比同行差。
我认为这是目前区分"AI 收入"质量最实用的一条线,比区分"模型层还是应用层"更管用。
VERIFY / 04
四、指标变成目标之后
今年有二十五位数学界最高奖项的得主发表了一份联合声明。他们的核心指控不是"AI 不该做数学",而是:
把"解决了多少著名难题、多快解决"当作"概念理解与洞见"的能力指标。
一旦指标本身变成目标,工具就会开始伤害目标。
他们的担忧具体而不抽象:一个重大问题被解决,过去意味着有了新方法、新视角,此后共同体要花很多年把它变成别人能理解和使用的知识。答案不是终点,答案如何进入已有知识体系才是。 而当结果被批量、快速地抛出来,这个消化过程就被跳过了。
这件事对投资的意义,不在于道德判断,在于它提示了一种系统性的读数偏差:
可被快速量化的指标,会挤掉难以量化但更重要的指标——不是因为有人作弊,而是因为前者能进 PPT。
我在自己的判断里也犯过同一类错误。能算出来的东西天然占据注意力,哪怕它不是那个决定性的东西。
VERIFY / 05
五、还有一个时间尺度的错位
同一份材料里有个容易被略过的事实:那个奖项设立二十多年来,七道大奖难题中,被官方正式确认解决的至今只有一道。
权威确认的周期以年计,公司发布的周期以周计。
这两个时钟的差,本身就是一条可用的判读规则:
"某公司宣布解决"和"该领域确认解决",是两个不同强度的事实。 前者由发布方定义,后者由第三方定义。默认按前者处理。
这条规则不针对任何一家公司。它针对的是我们自己的接收方式——我们习惯用报道的密度来估计进展的速度,而报道密度由发布节奏决定,不由验证节奏决定。
VERIFY / 06
六、这个判断可能错在哪
第一,最重要的一条:验证器本身可能被造出来。 如果模型能为低可验证领域自动生成足够好的评判标准(自动化测试、可复现的评估流程、模拟环境),那么下半张表会逐步向上半张表迁移。这是我最无法排除的反证,也是最值得跟踪的方向。
第二,"廉价验证器"和"正确验证器"不是一回事。 软件领域的测试很便宜,但测试本身可能是错的、覆盖不全的。便宜的裁判会带来另一种失败:大量通过测试但方向错误的产出。
第三,本文的表格是我按常识排的,不是测量出来的。 每个领域"一次判定的成本"我没有量化依据,只有量级直觉。这是本文最弱的一环。
第四,下半张表未必没有生意。 在验证昂贵的领域,AI 也可以只做辅助与初筛,把最终判定留给人。这类生意的天花板更低,但未必不成立——本文的筛子会低估它们。
VERIFY / 07
七、可以跟踪的三个信号
—企业采购时是否为"可验证性"单独付费:审计日志、可复现记录、责任界定条款是否进入合同正文。—低可验证领域是否出现被广泛接受的第三方评估标准:这是第六节反证一兑现的第一个迹象。—事故之后的续订率:这是检验"下半张表的收入更脆弱"这个判断最直接的数据,可惜通常不披露。
VERIFY / 08
八、本文的置信度分层
| 层级 | 内容 | 可靠性 |
| 技术事实 | 大规模搜索依赖形式化验证收尾 | 公开报道,多源一致 |
| 一手声明 | 二十五位得主的联合声明及其指控 | 声明原文可查 |
| 事实对比 | 大奖难题官方确认数量与周期 | 公开事实 |
| 结构判断 | 验证器成本决定可外推性 | 本文核心,逻辑推演 |
| 领域分级表 | 各领域判定成本高低 | 常识排序,无量化依据 |
| 最大反证 | 验证器本身可能被自动生成 | 无法排除 |
这一篇和第十三篇是一对。 第十三篇说"验证正在变成价值高地",这一篇说"验证成本决定了哪些领域根本进不去"。如果只能记住一句,我希望是这句:看到一个惊人的能力演示,先找裁判在哪。
方法说明:本文讨论能力演示向商业价值转化的边界条件,领域分级为作者常识排序、无量化依据,已在第八节标明。不评价任何具体公司,不涉及估值、仓位或买卖判断。不构成投资建议。