← 半导体与AI投资目录

半导体与AI投资 25|自我改进有没有迹象:把一句口号拆成五个条件

SEMICONDUCTOR / AI INVESTING14 SEP 2026

半导体与AI投资 25|自我改进有没有迹象

「AI 开始自我改进了」——这句话这两年反复出现,每次都能推动一轮情绪。但它几乎从来没有被拆开过:到底要发生什么,才算自我改进真的开始了?

一个不能被拆成条件的命题,既不能被证实,也不能被证伪,只能被相信。这一篇把它拆成五个都能查的条件,然后逐条对照现在能看到的公开证据。

LOOP

01

回路·五个零件

GAP

02

空白·自我验收

PRICING

03

定价·两种形状

SEMICONDUCTOR / 01

一、先把「自我改进」定义成一个回路

所谓递归自我改进,说的是这样一个闭环:

模型 → 产出改进 → 得到更好的模型 → 产出更大的改进 → ……

关键在「递归」两个字:不是改进一次,是改进出来的东西能接着改进下一轮。

要让这个环转起来,至少需要五个零件:

条件通俗说
能产出训练信号它得造得出比自己现有水平更好的材料
能把信号吃进去训练这一步得自动化
能判断改好没改坏它得会验收自己
每轮增量不衰减第十轮的进步不能接近于零
人不在关键路径上否则速度上限是人的速度

五个缺一不可——这是回路的定义决定的,不是我的偏好。

SEMICONDUCTOR / 02

二、逐条对照:现在到哪一步了

条件二(自动化管线):已经成立,而且成了商品

最近一个具体的例子,是 Google Cloud 文档里的《Supervised and distillation fine-tuning for open models》。它做的事情很清楚:指定一个强的「教师」模型生成回答,用这些回答去调一个更小的「学生」模型,整条流程产品化、有配额、有价目表。

文档原文写的是:「Distillation lets you tune a smaller student model using the outputs of a larger teacher model.」(蒸馏让你用更大的教师模型的输出,去调一个更小的学生模型。)并写明它最适合把复杂的多步推理能力从大教师迁移到小学生

⇒ 这意味着「推理时花掉的算力」可以被沉淀进权重。贵模型慢慢想出来的过程,被压进便宜模型里,下次它不必再想一遍。

这一条实实在在地成立了。 管线不再是实验室里的手工活,是一个可以下单的服务。

条件一(产出训练信号):只成立了一半

蒸馏证明了「强模型的产出可以当训练材料」。但它的方向是向下的。

方向天花板
蒸馏让小模型逼近大模型天花板是教师
自我改进让模型超过自己定义上没有天花板

而这次公布的型号清单本身就说明了这一点,而且比「方向向下」还多说了一层:

文档列出的型号
可选教师DeepSeek R1 0528、DeepSeek V3.2、Qwen 3 Next 80B A3B Thinking
可选学生Qwen 3(4B/8B/14B/32B)、Gemma 3、Llama 3.1/3.2/3.3、Llama 4 Scout

两件事同时成立:

整条链没有任何一步产出比教师更强的东西——学生的天花板就是教师。
教师里没有这家云厂商自己的旗舰模型。 能当教师的是第三方开源模型;学生也是开源模型。它卖的是把别人的模型压进更小的别人的模型的那条管道。

⇒ 「能复制自己」和「能超过自己」之间,隔着整个问题。

条件三(自我验收):最关键的一环,没有公开进展

这是五个条件里最难、也最被忽略的一个。

回路要自动转,就必须自动判断这一轮到底是变好了还是变坏了。而这正是本系列反复说的那个瓶颈:生成早就不是难点,确认它对不对才是。

没有可靠的自动验收,回路照样能转——只是它会以更快的速度往错的方向走。

一个没有刹车的自我改进回路,不是更危险的成功,是更快的失败。

关于这一环,目前没有任何公开的、可验证的重大进展。这是整个判断里最大的空白。

条件四(增量不衰减):有反向证据

这是最该被注意、却最少被引用的一面。

同一家公司承诺的新一代旗舰迟迟未发布;有报道称内部候选版本被拒的理由是「相对便宜型号的提升不够」。与此同时,便宜的那条产品线在很短时间里连发了多个版本。

把这两件事放在一起看,形状很清楚:

快的是便宜那条线,停的是最强那条线。

而这正是增量衰减的样子——不是不进步,是在最贵的那一档上,每一轮的增量已经不足以支撑发布。

条件五(人不在关键路径):反着来的

这项服务是卖给客户的产品:客户准备数据、客户选型号、客户发起训练、客户验收结果,还要按教师模型的用量付费人在每一步。

这不是缺点,是它作为商品的正常形态。但它说明这条链不是为「无人闭环」设计的。

SEMICONDUCTOR / 03

三、把五条合起来

条件状态
一 · 产出训练信号半成立(能向下复制,未见向上超越)
二 · 自动化管线成立,且已商品化
三 · 自我验收无公开进展 —— 最大空白
四 · 增量不衰减有反向证据
五 · 人不在关键路径反着来

⇒ 现在的状态既不是「已经发生」,也不是「不可能」。

是:零件在陆续到位,而最难的那个零件,没有任何公开进展。

SEMICONDUCTOR / 04

四、对投资者来说,真正的分野在这里

这一节比上面所有内容都重要。

「自我改进」和「工程优化」会被同一批新闻描述,但它们对投资的含义完全相反:

自我改进工程优化
表现最强的那个变得更强便宜的那个变得够用
算力需求上不封顶单位任务成本持续下降
利润流向前沿玩家赢家通吃能力商品化,利润从模型层挤走

而现在能观察到的,是后者的形状。

这不是坏消息,但它是一个完全不同的投资命题。

把工程优化当成自我改进来定价,赌的是一件没有发生的事。

SEMICONDUCTOR / 05

五、顺带说一句厂商的措辞

厂商的官方表述里,已经出现了「以长周期的智能体循环,递归地评估并改进底层模型」这类说法。

这句话本身是真实存在的,但它是主张,不是证据。

在这个行业,叙事先于事实是常态;问题在于市场会先按叙事定价。

所以读这类表述的正确姿势是:把它记下来,当成一条待验证的承诺,而不是一条已发生的事实——然后去看下面那五个数字。

SEMICONDUCTOR / 06

六、五个你自己能查的判据

旗舰型号的发布间隔。 间隔拉长 = 增量在衰减。
蒸馏链里有没有出现「学生 ≥ 教师」,或者学生被反过来当作下一轮的教师。出现即回路闭合的第一个硬信号。
同等能力的单位成本下降斜率。 平滑下降 = 工程优化;断裂式暴跌 = 值得警觉。
有没有出现真正的自动验收产品。 这是最难的一环,它一旦被解决会非常显眼。
人在回路里的位置。 厂商是否开始宣称训练与验收环节无人干预。

SEMICONDUCTOR / 07

七、这篇判断怎么算错

观察点什么结果推翻它
条件一出现「学生超过教师」的公开、可复核结果 → 第二节「方向向下」错
条件三出现可验证的自动验收方案 → 「最大空白」这一条作废,整篇结论要重估
条件四新一代旗舰发布且相对便宜型号提升显著 → 「增量衰减」错
第四节若单位成本出现断裂式下跌而非平滑下降 → 「现在是工程优化」的判断错

四条都在公开信息里,不需要等很多年。

SEMICONDUCTOR / 08

八、收口

「它开始自我改进了」——这句话要么是这个时代最重要的事实,要么是这个时代最贵的一句叙事。

区别不在于谁说得更肯定,在于它有没有被拆成能查的条件。

拆完之后会发现:五个条件里,容易的那几个已经成了商品,最难的那个连一份公开进展都没有。

而这恰恰是这类判断最常见的形状——不是有人在撒谎,是最好办的部分先办完了,然后所有人开始按整件事已经办完来定价。

本篇为产业判断分析,不推荐任何标的,不涉及估值、仓位或买卖建议,不构成投资建议。

阅读依据:蒸馏功能的说明、可选教师与学生型号清单、以及「最适合把复杂多步推理能力从大教师迁移到小学生」这一适用场景,均取自 Google Cloud 公开文档页《Supervised and distillation fine-tuning for open models》(Gemini Enterprise Agent Platform),本人访问原页逐项核对。第四节关于旗舰发布节奏的内容为公开报道的大意转述,非原文引用,请以原始报道为准。