← 半导体与AI投资目录

半导体与AI投资 45|7G 的图书管理员,390G 的学者

SEMICONDUCTOR / AI INVESTING14 SEP 2026

7G 的图书管理员
390G 的学者

问 AI 一个问题,直觉里是一个大脑在回答你。拆开一套真实运转的系统看,里面至少站着两个人。

一套能回答专业问题的本地 AI,实际由两个互不相通的模型组成:7G 的负责找,390G 的负责想,中间只传原文。这个分工形态,和"一个超级大脑通吃一切"的叙事方向相反——而算力需求和价值分布,跟着形态走,不跟着叙事走。

FIND

01

小模型管找,一秒一次

THINK

02

大模型管想,只读原文

SWITCH

03

换管理员=全库重建

SEMICONDUCTOR / 01

一、两个模型,两份工作

在一台本地工作站上,回答一个专业问题的全过程是这样的:

第一个模型只有 7G,叫嵌入模型,角色是图书管理员。它不会写字、不会回答问题,只会一件事:把任何一段文字变成两千多个数字——一个"意思坐标"。它提前把一万三千多段资料各读一遍、记下坐标;每次提问,它把问题也变成坐标,一秒之内找出坐标最近的几段。

第二个模型 390G,是学者。它读题、思考、写回答——但它看不懂那些坐标。管理员交给它的,是找出来的那几段原文。

关键在交接方式:学者从没见过坐标,管理员从不参与回答,它们之间只传原文。 两个模型出身不同的公司、结构完全不同、互相不知道对方存在——把它们连成一套系统的,是中间几十行普通程序。

SEMICONDUCTOR / 02

二、为什么不让学者自己找

因为贵,而且没有必要。让 390G 的学者通读一万三千段资料再回答,每一问都是天价;7G 的管理员一秒钟完成同一件事,成本几乎为零。专用零件干专用的活,是这套系统能在一台机器上跑起来的全部原因。

这个分工不是权宜之计,是方向。看图的、精排的、写代码的、管找的、管想的——生产系统里的模型数量在变多,单个零件在变专。这就是转向:AI 系统的形态是分工,不是独脑。 "等一个足够强的大模型出来,一切外挂都不需要了"——这个预期与工程演化的实际方向相反:模型越强,围绕它的专用零件反而越多,因为每个零件都在替那个最贵的大脑省钱。

SEMICONDUCTOR / 03

三、投资上:跟着形态走,不跟着叙事走

形态决定两件账。

第一,算力需求的结构。 如果未来是"单一巨模型通吃",算力需求曲线就是旗舰模型的调用曲线;如果形态是分工,那么大量调用发生在 7G 这一级——检索、分类、精排,每次调用的成本比旗舰低两个数量级以上。同样一句"AI 使用量暴涨",落在哪一级零件上,对芯片、对云、对电力的含义完全不同。判读需求预测时,值得先问:它假设的是哪种形态?

第二,粘性长在接线处。 这套系统里最不起眼的零件,藏着最真实的切换成本:两个管理员的坐标体系互不通用——换一个嵌入模型,一万三千段资料要全部重建索引;而换学者(换大模型),索引一动不用动。第 43 篇说客户离开要留下"带不走的对话",这里是同一个判断的另一处落点:资产沉淀在数据与索引层,大模型本身是这套系统里最容易被换掉的零件。 一家 AI 应用公司告诉你它的壁垒是"接入了最强模型",按这个形态看,它说的恰恰是自己最没有壁垒的那一层。

SEMICONDUCTOR / 04

四、这个判断什么时候失效

三种情形要重估。一,端到端的单体模型真把"找"内化了——检索能力并入大模型且总成本更低,分工形态被吞并,那是范式变化,本文作废;二,意思坐标出现通用标准——各家嵌入模型的坐标可互相迁移,重建索引的切换成本消失,粘性判断随之失效;三,你的任务足够简单——不需要外部资料,一个模型直接答,那么本文讨论的分工从一开始就不存在。

本篇为系统形态与算力结构分析。文中结构与数字来自单一环境的本地部署实测,随软硬件配置变化,不构成对任何产品的评价结论,不推荐任何标的,不构成投资建议。

阅读依据:双模型分工结构(约 7G 嵌入模型/约 390G 大模型、二千余维意思坐标、检索约一秒一次)为本地自有环境部署实测;「一万三千多段私人语料」沿用本系列第 41 篇口径;「坐标体系互不通用、换嵌入模型需全库重建」为嵌入模型的公开通性。「带不走的对话」承接第 43 篇,「收租位置在数据与检索层」承接第 41 篇。