SEMICONDUCTOR / AI INVESTING14 SEP 2026
半导体与AI投资 37|AI 能自我改进的地方,恰好是能自动打分的地方
过去两周,「AI 自我进化」这个词大概轰炸过你好几次:谷歌披露智能体优化自己的调用策略,智谱让模型参与优化自己的推理系统,创业公司宣称智能体靠改写记忆持续变强,然后是行业巨头突然开始谈「放慢」。这些新闻放在一起,很容易读出一个印象:AI 改进 AI 的飞轮已经转起来了,接下来是指数起飞。
一个系统可能因为不断学习而变强,也可能因为不断学习,被自己过去的经验越箍越紧。「会学习」只是第一步,难的是知道哪些经验该信、哪些该忘。
THE GRADIENT 01 即时判分→延迟反馈→无统一标准 |
SECOND WALL 02 只学成功会变笨 |
ASK THIS 03 分数是谁打的 |
把这几个案例拆开看,会发现它们全部长在同一块很小的地盘上。
AI 能自我改进的地方,恰好是能被自动打分的地方——判分器的边界,就是这一轮「自我进化」叙事的边界。
SEMICONDUCTOR / 01
一、把最近的案例排在一条线上
先看都发生了什么。谷歌那个系统把历史搜索记录做成回放模拟器,让新策略在旧数据里离线重演,挑出最优再上真实任务——它能成立的唯一前提,是历史上每一步都被自动判过分。智谱让模型参与优化自家推理基础设施——优化对象是数值误差、线程等待、算子耗时,每一项都有仪表可读。学术圈的智能体自我改进研究,最亮眼的成绩集中在 GPU 内核优化——改一次代码跑一遍,快了就是快了,慢了就是慢了。
三个案例,同一个形状:任务的对错由机器当场裁决,不需要人出场。
再看判分变难时发生什么。有研究团队做过经营模拟测试——让智能体模拟经营公司,反馈要等一段时间才显现(这次决策之后客户变多还是变少),归因开始模糊,不更新的模型会把公司一路开到破产。到了写作风格这类任务,「好」的定义本身因人而异,连一个统一的判分器都不存在——自我改进在这里基本失灵。
这是一条清晰的梯度:判分即时且无争议的任务,自我改进跑得飞快;反馈延迟但可归因的任务,勉强能跑;「好」没有统一定义的任务,跑不动。
SEMICONDUCTOR / 02
二、更麻烦的是:判分器管不住「学坏」
即使在能判分的地盘上,还有第二道墙。两个互相独立的团队最近撞上了同一个发现:让模型从自己的成功经验里学习,处理不当反而会变笨。
机制值得细看。解决一个问题时,模型可能先试了 A,不对;再试 B,还是不对;最后 C 成功了。如果只把「做 C」学进去、丢掉 A 和 B 的失败过程,模型学到的是答案,丢掉的是推理——下次遇到变体问题,它会直接跳向「类似 C」的答案,而不是重新推理。谷歌那边的对照实验更直接:把历史经验总结成自然语言(「哪些方向曾成功」)加进提示词,效果持续变差,因为偶然的成功被固化成了强先验,搜索空间过早收缩。
所以「自我改进」的完整门槛是两道:先要有能自动判分的环境,再要有不把碰巧当规律的学习机制。第一道决定它能在哪里跑,第二道决定它跑起来是变强还是变笨。
SEMICONDUCTOR / 03
三、投资含义:给「自我进化」故事装一个过滤器
理解了这两道墙,最近的几类新闻就可以分拣了。
厂商说「我们的智能体在自我进化」——先问它进化的任务有没有自动判分器。有(代码、内核、基础设施优化),这个说法可信但地盘有限;没有(通用助理、写作、经营决策),这个说法目前没有技术基础,按叙事处理。
厂商给出「效率提升 N 倍」——本系列的老规矩,查分母。这个领域的对比基线花样最多:跟别家模型比、跟自己的初始版本比、跟不用工具的裸模型比,数字可以差出两个数量级。
至于巨头谈「放慢」——上周那轮「集体踩刹车」的言论,我们核过原文:呼吁的是能力推进节奏和安全评估,没有一个字涉及削减芯片采购或资本开支,同期两家头部实验室的算力合同还在扩大。言论层的刹车和行为层的扩容同时存在时,观测行为。安全姿态正在变成一个竞争维度,这和减速是两件事。
对算力需求的推论也变得清楚:如果自我改进短期内只在「可判分」的地盘上成立,那它产生的算力需求是真实但有边界的——写代码、优化系统这类任务会越来越自动化并消耗海量推理算力,而「AI 全面自我进化导致算力需求无限外推」的版本,目前不被证据支持。真实的需求曲线介于两者之间,跟着判分器能覆盖的任务范围走。
SEMICONDUCTOR / 04
四、反方与观测
反方两条。第一,判分器的边界不是固定的——行业正在把越来越多任务改造成可判分的形态(给模糊任务造基准、造模拟环境),边界本身在外扩,只是外扩速度远慢于叙事。第二,「能力加权限」是另一个变量:今天智能体被允许触碰的范围(改代码库、动基础设施)在快速放宽,同样的能力配上更大的权限,表现出的「进化」会突然加速——这不是能力跃迁,是授权跃迁,投资判断上要分开记账。
观测项三个:有没有自我改进系统在「反馈延迟、可归因」的中间地带(经营类、多步骤业务流程)拿出可复现的成绩——那才是边界真正外扩的信号;模型厂商的评估件和模拟环境有没有开始单独收费——判分器本身变成生意,是这个瓶颈被行业确认的标志;以及任何一家实验室把「安全评估」写进对外合同条款——那是「刹车」从姿态变成机制的读数。
SEMICONDUCTOR / 05
收口
「AI 改进 AI」听起来是个能力故事,拆开看是个基础设施故事:它跑得快不快,不取决于模型多聪明,取决于有多少任务已经被改造成机器可以当场判对错的形状。
下次看到「自我进化」,别问它有多智能,问它的分数是谁打的。打分的是机器,故事就有地基;打分的还是人,故事就还在等待它的基础设施。