SEMICONDUCTOR / AI INVESTING14 SEP 2026
半导体与AI投资 30|阶梯的最后一级,是它能不能判断自己做得对
判断一个行业走到哪一步,最好的材料往往不是分析师的报告,而是从业者自己画的路线图——尤其当这张图把自己所处的位置也标了出来。
一家中国模型公司在 2026 年中期财报里给出了这样一张图:五级能力阶梯,必须顺序走完,每一级之间有一道具体的技术门槛。
LADDER 01 阶梯·五级四槛 |
REVIEW 02 判据·改还是重做 |
CALIBER 03 口径·75 还是 1000 |
而它把最难的那道门槛,放在了最后一级——那道门槛恰好就是「模型能不能判断自己做得对不对」。
SEMICONDUCTOR / 01
一、这张阶梯长什么样
Chat → Coding → Agent → Co-work → Autonomous AI。
每一级的交付物不同:Chat 交付一次回答;Coding 交付可运行的代码;Agent 交付被执行完的多步任务链;Co-work 交付可被专业人士复核的工作成果;Autonomous 交付持续运行的能力。
关键在于它声称这条路必须顺序走完、不能跳级。 因为每一级之间都卡着一道门槛:
| 跃迁 | 门槛 |
| Chat → Coding | 结果可验证 |
| Coding → Agent | 长程规划与错误恢复 |
| Agent → Co-work | 可靠性达到专业人士愿意复核,而非推倒重做 |
| Co-work → Autonomous | 模型能否自己判断做得对不对 |
门槛跨不过去,上一层的商业模式就不成立。
SEMICONDUCTOR / 02
二、第三道门槛的那句定义,值得单独记住
「可靠性达到专业人士愿意复核,而非推倒重做。」
这是我见过对「AI 够不够用」最好的操作性定义。
它好在哪里?因为它不谈准确率,谈的是接收方的行为。
—一个八十分的产出,如果专家看完愿意在上面改,它就有价值—一个同样八十分的产出,如果专家看完决定重写,它的价值是负的——因为还浪费了看的时间
⇒ 判断 AI 在某个岗位上能不能用,不要问「它准确率多少」,问「拿到结果的人,是改还是重做」。
这个判据不需要任何技术知识,任何一个用过的人都能回答。 而它比任何评测分数都更接近商业价值。
SEMICONDUCTOR / 03
三、最后一道门槛,是整个行业的同一个缺口
「模型能否自己判断做得对不对」——这是自我验收。
一家正在卖模型的公司,把它列为最高一级、尚未跨过的关卡。 这一点很重要:
这是一个利益相反的证词。
卖模型的人没有动机把自家产品的天花板画得更低,除非那个天花板是真的。
而这跟本系列此前反复说的是同一件事:生成早就不是难点,确认才是。
要补充的是一个必要的限定:
在有判定程序的领域,自我验收已经可以闭环——比如数学证明有形式化验证工具,检查器输出的是明确的是或否,不需要品味、不会有歧义。
但绝大多数商业任务没有这样的检查器。 写一份分析、改一段业务代码、做一个方案——没有判定程序,验收仍然要人。
⇒ 自我验收不是「还没做到」,是「在有标准答案的地方做到了,在没有标准答案的地方还没有」。
而商业价值的绝大部分,在后者。
SEMICONDUCTOR / 04
四、同一份材料里,还有一个受控实验
这家公司做了一件行业里少见的事:一次接近受控的对照。
新版本与上一版同架构、同总参数、同激活参数,唯一的变量是后训练的规模——用一个月放大长程任务环境与强化学习。结果是在其自建的真实场景编码评测中,端到端完成率较上一版提升超过 50%。
这个实验的意义超出一次产品迭代:它在控制了架构与参数的前提下,说明「把模型做强」不止「把参数做大」一条路,后训练可能是当下投入产出比更高的那条。
但该公司自己给了限定,这一点值得照抄:
受控实验证明的是「后训练有效」,没有证明「后训练的收益不会递减」。
第一次放大拿到 50%,第二次可能只有 25%。下一个真正的验证点,是再下一代能不能靠同样的办法拿到同量级的提升。
⚠️ 另需说明:那个 50% 用的是该公司自建的评测,不是公开基准。自建评测的结果,方向可信,幅度打折。
SEMICONDUCTOR / 05
五、一处必须提醒的口径问题
同一批材料里出现了「推理成本三年下降约 75 倍」的说法。
而另一个来源(一家上市软件公司的技术高管在财报电话会上)给出的同一指标是「三年便宜约一千倍」。
两者相差十三倍。
⇒ 「便宜了 N 倍」这句话高度依赖口径——哪个模型算同级、输入还是输出 token、含不含推理过程的 token、是牌价还是实付。
凡是看到这类倍数,先问口径,再用它做任何推论。
本系列上一篇用的是一千倍那个口径。在此标注:该数字存在数量级差异的其他来源。 那篇的结论只依赖「用量增幅 ÷ 价格降幅」的比值,方向不受影响,但引用具体倍数时应当同时给出两个口径。
SEMICONDUCTOR / 06
六、还有一条容易被读错的
同一份材料提到,该公司首次在超大规模真实流量中全面使用本土芯片集群提供服务,并称多家本土芯片平台已完成深度推理适配。
⚠️ 这里必须分清:这是推理,不是训练。
推理侧可以用替代方案跑起来,不等于训练侧的约束解除了。
两者对制程、互联带宽、集群规模的要求完全不在一个量级。
所以正确的读法是:把「算力受限」拆成训练受限与推理受限两项——后者正在缓解,前者没有证据表明缓解。
把这两项混着读,会得出过于乐观或过于悲观的结论,取决于你混的方向。
SEMICONDUCTOR / 07
七、这篇判断怎么算错
| 观察点 | 什么结果推翻它 |
| 最后一道门槛 | 出现可验证的、适用于无标准答案任务的自动验收方案 → 第三节作废 |
| 后训练递减 | 再下一代仍靠后训练拿到同量级提升 → 「收益递减」的担心不成立 |
| 阶梯的顺序性 | 出现跳级案例(未过 Co-work 门槛却做成 Autonomous 交付) → 第一节的框架错 |
| 事实层 | 本文所引阶梯、门槛、实验与数字,均来自对一份公开财报的二手解读,本人未见财报原文;若原文不符,相应结论作废 |
SEMICONDUCTOR / 08
八、收口
判断一项技术走到哪一步,最有信息量的材料,是从业者自己标出的那个「还没跨过去」。
因为所有人都倾向于把自己能做的说满,把不能做的略过。一份路线图如果明确写出了最后一级尚未到达,那一级就值得当真。
而这一次,那一级是:它还不能判断自己做得对不对。
在它能之前,每一次输出后面都得站一个人。而那个人的时间,就是这门生意真正的成本上限。