← 半导体与AI投资目录

半导体与AI投资 30|一家公司自己画的阶梯,把最后一级留给了「它能不能判断自己做得对」

SEMICONDUCTOR / AI INVESTING14 SEP 2026

半导体与AI投资 30|阶梯的最后一级,是它能不能判断自己做得对

判断一个行业走到哪一步,最好的材料往往不是分析师的报告,而是从业者自己画的路线图——尤其当这张图把自己所处的位置也标了出来。

一家中国模型公司在 2026 年中期财报里给出了这样一张图:五级能力阶梯,必须顺序走完,每一级之间有一道具体的技术门槛。

LADDER

01

阶梯·五级四槛

REVIEW

02

判据·改还是重做

CALIBER

03

口径·75 还是 1000

而它把最难的那道门槛,放在了最后一级——那道门槛恰好就是「模型能不能判断自己做得对不对」。

SEMICONDUCTOR / 01

一、这张阶梯长什么样

Chat → Coding → Agent → Co-work → Autonomous AI。

每一级的交付物不同:Chat 交付一次回答;Coding 交付可运行的代码;Agent 交付被执行完的多步任务链;Co-work 交付可被专业人士复核的工作成果;Autonomous 交付持续运行的能力。

关键在于它声称这条路必须顺序走完、不能跳级。 因为每一级之间都卡着一道门槛:

跃迁门槛
Chat → Coding结果可验证
Coding → Agent长程规划与错误恢复
Agent → Co-work可靠性达到专业人士愿意复核,而非推倒重做
Co-work → Autonomous模型能否自己判断做得对不对

门槛跨不过去,上一层的商业模式就不成立。

SEMICONDUCTOR / 02

二、第三道门槛的那句定义,值得单独记住

「可靠性达到专业人士愿意复核,而非推倒重做。」

这是我见过对「AI 够不够用」最好的操作性定义。

它好在哪里?因为它不谈准确率,谈的是接收方的行为

一个八十分的产出,如果专家看完愿意在上面改,它就有价值
一个同样八十分的产出,如果专家看完决定重写,它的价值是负的——因为还浪费了看的时间

⇒ 判断 AI 在某个岗位上能不能用,不要问「它准确率多少」,问「拿到结果的人,是改还是重做」。

这个判据不需要任何技术知识,任何一个用过的人都能回答。 而它比任何评测分数都更接近商业价值。

SEMICONDUCTOR / 03

三、最后一道门槛,是整个行业的同一个缺口

「模型能否自己判断做得对不对」——这是自我验收。

一家正在卖模型的公司,把它列为最高一级、尚未跨过的关卡。 这一点很重要:

这是一个利益相反的证词。

卖模型的人没有动机把自家产品的天花板画得更低,除非那个天花板是真的。

而这跟本系列此前反复说的是同一件事:生成早就不是难点,确认才是。

要补充的是一个必要的限定:

有判定程序的领域,自我验收已经可以闭环——比如数学证明有形式化验证工具,检查器输出的是明确的是或否,不需要品味、不会有歧义。

但绝大多数商业任务没有这样的检查器。 写一份分析、改一段业务代码、做一个方案——没有判定程序,验收仍然要人。

⇒ 自我验收不是「还没做到」,是「在有标准答案的地方做到了,在没有标准答案的地方还没有」。

而商业价值的绝大部分,在后者。

SEMICONDUCTOR / 04

四、同一份材料里,还有一个受控实验

这家公司做了一件行业里少见的事:一次接近受控的对照。

新版本与上一版同架构、同总参数、同激活参数,唯一的变量是后训练的规模——用一个月放大长程任务环境与强化学习。结果是在其自建的真实场景编码评测中,端到端完成率较上一版提升超过 50%。

这个实验的意义超出一次产品迭代:它在控制了架构与参数的前提下,说明「把模型做强」不止「把参数做大」一条路,后训练可能是当下投入产出比更高的那条

但该公司自己给了限定,这一点值得照抄:

受控实验证明的是「后训练有效」,没有证明「后训练的收益不会递减」。

第一次放大拿到 50%,第二次可能只有 25%。下一个真正的验证点,是再下一代能不能靠同样的办法拿到同量级的提升。

⚠️ 另需说明:那个 50% 用的是该公司自建的评测,不是公开基准。自建评测的结果,方向可信,幅度打折。

SEMICONDUCTOR / 05

五、一处必须提醒的口径问题

同一批材料里出现了「推理成本三年下降约 75 倍」的说法。

而另一个来源(一家上市软件公司的技术高管在财报电话会上)给出的同一指标是「三年便宜约一千倍」。

两者相差十三倍。

⇒ 「便宜了 N 倍」这句话高度依赖口径——哪个模型算同级、输入还是输出 token、含不含推理过程的 token、是牌价还是实付。

凡是看到这类倍数,先问口径,再用它做任何推论。

本系列上一篇用的是一千倍那个口径。在此标注:该数字存在数量级差异的其他来源。 那篇的结论只依赖「用量增幅 ÷ 价格降幅」的比值,方向不受影响,但引用具体倍数时应当同时给出两个口径。

SEMICONDUCTOR / 06

六、还有一条容易被读错的

同一份材料提到,该公司首次在超大规模真实流量中全面使用本土芯片集群提供服务,并称多家本土芯片平台已完成深度推理适配。

⚠️ 这里必须分清:这是推理,不是训练。

推理侧可以用替代方案跑起来,不等于训练侧的约束解除了。

两者对制程、互联带宽、集群规模的要求完全不在一个量级。

所以正确的读法是:把「算力受限」拆成训练受限与推理受限两项——后者正在缓解,前者没有证据表明缓解。

把这两项混着读,会得出过于乐观或过于悲观的结论,取决于你混的方向。

SEMICONDUCTOR / 07

七、这篇判断怎么算错

观察点什么结果推翻它
最后一道门槛出现可验证的、适用于无标准答案任务的自动验收方案 → 第三节作废
后训练递减再下一代仍靠后训练拿到同量级提升 → 「收益递减」的担心不成立
阶梯的顺序性出现跳级案例(未过 Co-work 门槛却做成 Autonomous 交付) → 第一节的框架错
事实层本文所引阶梯、门槛、实验与数字,均来自对一份公开财报的二手解读,本人未见财报原文;若原文不符,相应结论作废

SEMICONDUCTOR / 08

八、收口

判断一项技术走到哪一步,最有信息量的材料,是从业者自己标出的那个「还没跨过去」。

因为所有人都倾向于把自己能做的说满,把不能做的略过。一份路线图如果明确写出了最后一级尚未到达,那一级就值得当真。

而这一次,那一级是:它还不能判断自己做得对不对。

在它能之前,每一次输出后面都得站一个人。而那个人的时间,就是这门生意真正的成本上限。

本篇为产业结构分析,不推荐任何标的,不涉及估值、仓位或买卖建议,不构成投资建议。

阅读依据:能力阶梯、四道门槛、受控实验与各项数字,均来自一篇对某公司 2026 年中期财报的公开二手解读,**本人未见财报原文**;该「提升超过 50%」采用的是该公司自建评测而非公开基准;第五节所列两个成本口径分别来自该解读与另一家上市公司高管的财报电话会转述,二者相差约十三倍,正文已并列标注。