LOCAL LLM / DEPLOY GUIDE27 SEP 2026
让它读你的资料
图书管理员与学者
装好的模型(第四篇)有个根本短板:它对你的领域一无所知。你的笔记、你的文档、你行业的资料,它训练时都没见过。
本地模型从"玩具"变"工具"的分水岭,是让它读你自己的资料。这一篇讲那套行业里叫 RAG 的做法——用一个比喻就能记住:给学者配一个图书管理员。
SPLIT 01 切块:每段记住出处 |
FIND 02 小模型按意思找 |
CITE 03 只传原文,必标出处 |
LOCAL LLM / 01
一、先排除两条歧路
歧路一:指望它"记住"。 把资料整段贴给它,这一轮它知道,下一轮就忘——模型没有记忆,每次对话都从零开始。
歧路二:指望训练。 把资料"练进"模型参数,家用机做不动认真的训练,而且练进去的知识会跟原有知识糊在一起,还是会编。
这就是转向:知识装不进模型的脑子,正路是开卷考试——每次提问前,先把资料里最相关的几段找出来,连同问题一起递给它,并规定"只能引用给你的内容,没有就说没找到"。资料永远精确,模型只负责读和想。
LOCAL LLM / 02
二、图书管理员与学者
这套系统里站着两个模型,分工严格:
图书管理员是个只有几个 G 的小模型(嵌入模型)。它不会回答问题,只会一件事:把任何一段文字变成两千多个数字——一个"意思坐标"。部署时它把你的全部资料读一遍、记下每段的坐标(一次性,几千段资料个把小时);之后每次提问,它一秒之内找出坐标最近的几段。
学者就是你装好的大模型。它看不懂坐标——管理员交给它的是找出来的原文。它读原文、思考、回答,并标出每句话来自哪份资料。
两个模型互不相通,中间只传原文。 这个结构有个漂亮的推论:换学者(升级大模型),资料索引一动不用动;而管理员漏找了,再强的学者也无从引用——回答质量的上限在检索,不在模型。
LOCAL LLM / 03
三、动手的四步和三个坑
四步:①切块——把资料按标题切成几百到两千字的段,每段记住出处(哪份文件、哪一节);②建索引——管理员逐段记坐标;③检索——每问取最相关的几段,按意思找和按字面找合用;④约束——系统指令里写死"只引用给到的内容,标出处,没有就说没找到"。
三个坑,都来自实测:
—意思检索会漏比喻。"标准逐年悄悄降低"这类描述,按意思能找到讲同一现象的章节,哪怕没有一个词相同;但四字成语、比喻性说法经常漏——所以字面检索必须保留,两条腿走路—出处必须真的核对。检索错了还照常标出处,等于给错误答案披上可信的外衣——抽查它标的出处,翻回原文对几次—别贪多。每次只夹最相关的几段,不是越多越好——多塞的每一段都在拖慢回答、稀释重点
LOCAL LLM / 04
四、验收标准
问它三类题:资料里明确有的(该答对并标对出处)、资料里没有的(该老实说没找到,而不是编)、需要综合几段的(看它会不会串)。第二类最重要——一个不会说"没找到"的系统,比没有系统更危险。