← 半导体与AI投资目录

半导体与AI投资 41|模型会扩散,你的资料库不会

SEMICONDUCTOR / AI INVESTING14 SEP 2026

模型会扩散
你的资料库不会

AI 答得头头是道,你却不知道哪句能信——遇到这个问题,多数人的第一反应是:换个更强的模型。我们实测的结论是,这个方向不对。

同一批问题的对照实测:接上带出处的资料库,比换更强的模型更能改善「哪句能信」。回答质量的上限在检索和出处,不在模型——而收租的位置,只在不扩散的那一层。

CEILING

01

检索质量决定上限

PROOF

02

有出处才可核对

RENT

03

租只在不扩散的位置

SEMICONDUCTOR / 01

一组对照实验

在一台本地工作站上,我们给一个开源大模型做了两种配置:一种只靠它自己的记忆回答;另一种先由检索程序从一万三千多段私人笔记和资料里挑出最相关的几段,连同出处一起放进提问,并规定「只能引用给到的内容,没有就说没找到」。同一批八道题,两边各跑一遍——样本不大,结论按小样本对待。

结果有三点。第一,两边都没有编造书名章节——防编靠的是那条规定,不是资料库。第二,差别在内容:不接资料库,模型很老实地说「没找到」,然后给一段哪里都适用的通用分析——没编,但也没东西;接上之后,六道题都引用了真实存在的章节,每一句都能翻回原文核对。第三,代价是每次回答平均多等约二十七秒。

也就是说:模型负责推理,资料负责可信;换更强的模型,买不来第二样。 这就是转向:回答质量的上限不在模型的聪明程度,在检索交给它什么——检索漏掉的内容,再强的模型也无从引用。

SEMICONDUCTOR / 02

上限具体卡在哪

检索有两种找法。按字面找,擅长专有名词和精确引用;按意思找,是把每段文字变成一串「意思坐标」,坐标近的就是讲同一件事——问题换了说法、甚至换了语言,都找得到。

实测里最有意思的是它的边界,三个数放在一起看:一个描述「标准逐年悄悄降低」的问题,按意思找能命中讲同一现象的章节,相似度 0.57、全库排第一——两边没有一个词相同;同一件事的英文表述反而更近,0.65——它跨得过用词,也跨得过语言;但「温水煮青蛙」这个最常见的比喻,测出来只有 0.38,和不相关的段落一样远——坐标记的是语料里的共现,不是人脑的联想,比喻和隐喻会漏。所以两种找法必须合用,而且检索层本身需要持续调校。

这带出一个常被忽略的事实:检索层不是模型的附件,是独立的一层,有自己的质量、自己的坑、自己的积累曲线。而且两层的替换成本完全不对称:换大模型,索引一行都不用动,每一个后来的模型自动继承这套资料;换检索模型,坐标体系不通用,全库重建。哪一层是流水、哪一层是河床,一眼可辨。

SEMICONDUCTOR / 03

投资上的位置判断

开源模型现在大约三个月一换代,今天最强的,三个月后被追平是常态。会扩散的能力收不到租——这是本系列第 39 篇的判断,这里是它在应用层的延伸:AI 应用真正能收租的位置,不在模型层,在数据与检索层。

看一家 AI 应用公司,可以问三个问题。它的语料是不是独有的?公开语料上做检索,和模型一样会被复制。它的检索层会不会随使用变厚?用户每次提问、每次纠错,都在替它调校那一层,这是时间买不到的。客户离开它要付什么?两个检索模型的坐标体系互不通用,换一家意味着全部资料重建索引——这是真实的切换成本,而「换个模型」几乎没有。

模型层的军备竞赛越热,这个判断越值钱:烧钱造出来的能力在扩散,用出来的资料在沉淀。

SEMICONDUCTOR / 04

这个判断什么时候失效

一,任务本身不需要出处——创意写作、闲聊、头脑风暴,接资料库只添延迟;二,语料本身是公开的——那检索层和模型层一样收不到租,独有性才是前提;三,检索质量不过关——检索错了还照常给出处,等于给错误答案披上可核对的外衣,比没有出处更危险。第三条是这套做法自己的刀刃:出处让人放松警惕,所以出处本身必须先被核对。

本篇为应用层结构分析。文中对照实验为单一环境、八题小样本,数字仅代表当时配置,不构成对任何产品的评价结论,不推荐任何标的,不构成投资建议。

阅读依据:对照实验为本地工作站自有环境实测(约 1.3 万段私有语料、八题对照、平均延迟增加约 27 秒),小样本、未经第三方复现;「按意思找」的边界案例(同义改写命中、比喻不命中)为同批实测观察。「会扩散的东西收不到租」承接本系列第 39 篇的判断,此处为应用层延伸。语义检索边界的三个相似度数字(0.57/0.65/0.38)为同批实测、单一检索模型口径,应随资料库与检索模型版本变化复测,不作为配置结论引用。