SEMICONDUCTOR / AI INVESTING14 SEP 2026
7G 的图书管理员
390G 的学者
问 AI 一个问题,直觉里是一个大脑在回答你。拆开一套真实运转的系统看,里面至少站着两个人。
一套能回答专业问题的本地 AI,实际由两个互不相通的模型组成:7G 的负责找,390G 的负责想,中间只传原文。这个分工形态,和"一个超级大脑通吃一切"的叙事方向相反——而算力需求和价值分布,跟着形态走,不跟着叙事走。
FIND 01 小模型管找,一秒一次 |
THINK 02 大模型管想,只读原文 |
SWITCH 03 换管理员=全库重建 |
SEMICONDUCTOR / 01
一、两个模型,两份工作
在一台本地工作站上,回答一个专业问题的全过程是这样的:
第一个模型只有 7G,叫嵌入模型,角色是图书管理员。它不会写字、不会回答问题,只会一件事:把任何一段文字变成两千多个数字——一个"意思坐标"。它提前把一万三千多段资料各读一遍、记下坐标;每次提问,它把问题也变成坐标,一秒之内找出坐标最近的几段。
第二个模型 390G,是学者。它读题、思考、写回答——但它看不懂那些坐标。管理员交给它的,是找出来的那几段原文。
关键在交接方式:学者从没见过坐标,管理员从不参与回答,它们之间只传原文。 两个模型出身不同的公司、结构完全不同、互相不知道对方存在——把它们连成一套系统的,是中间几十行普通程序。
SEMICONDUCTOR / 02
二、为什么不让学者自己找
因为贵,而且没有必要。让 390G 的学者通读一万三千段资料再回答,每一问都是天价;7G 的管理员一秒钟完成同一件事,成本几乎为零。专用零件干专用的活,是这套系统能在一台机器上跑起来的全部原因。
这个分工不是权宜之计,是方向。看图的、精排的、写代码的、管找的、管想的——生产系统里的模型数量在变多,单个零件在变专。这就是转向:AI 系统的形态是分工,不是独脑。 "等一个足够强的大模型出来,一切外挂都不需要了"——这个预期与工程演化的实际方向相反:模型越强,围绕它的专用零件反而越多,因为每个零件都在替那个最贵的大脑省钱。
SEMICONDUCTOR / 03
三、投资上:跟着形态走,不跟着叙事走
形态决定两件账。
第一,算力需求的结构。 如果未来是"单一巨模型通吃",算力需求曲线就是旗舰模型的调用曲线;如果形态是分工,那么大量调用发生在 7G 这一级——检索、分类、精排,每次调用的成本比旗舰低两个数量级以上。同样一句"AI 使用量暴涨",落在哪一级零件上,对芯片、对云、对电力的含义完全不同。判读需求预测时,值得先问:它假设的是哪种形态?
第二,粘性长在接线处。 这套系统里最不起眼的零件,藏着最真实的切换成本:两个管理员的坐标体系互不通用——换一个嵌入模型,一万三千段资料要全部重建索引;而换学者(换大模型),索引一动不用动。第 43 篇说客户离开要留下"带不走的对话",这里是同一个判断的另一处落点:资产沉淀在数据与索引层,大模型本身是这套系统里最容易被换掉的零件。 一家 AI 应用公司告诉你它的壁垒是"接入了最强模型",按这个形态看,它说的恰恰是自己最没有壁垒的那一层。
SEMICONDUCTOR / 04
四、这个判断什么时候失效
三种情形要重估。一,端到端的单体模型真把"找"内化了——检索能力并入大模型且总成本更低,分工形态被吞并,那是范式变化,本文作废;二,意思坐标出现通用标准——各家嵌入模型的坐标可互相迁移,重建索引的切换成本消失,粘性判断随之失效;三,你的任务足够简单——不需要外部资料,一个模型直接答,那么本文讨论的分工从一开始就不存在。