LOCAL LLM / DEPLOY GUIDE27 SEP 2026
上岗前
用自己的题考它一遍
前五篇走完,你有了一个跑在自己电脑上、读你自己资料的模型。多数教程到这里就结束了。恰恰是这里,差着最重要的一步。
系列收官篇。模型装好了、资料接上了,最后一步不是开始用,是考试——用你自己的题。这一篇给出一套可操作的验收方法,和让系统长期不糊的三条维护规矩。
JOB 01 岗位考核,不是入学考试 |
RULES 02 同题三遍,越界不算过 |
KEEP 03 维护三规矩 |
LOCAL LLM / 01
一、为什么排行榜替你考不了
排行榜是入学考试:考的是平均考生面对平均任务的通用能力。你要的是岗位考核:这个模型,在你的资料、你的规矩、你的真实问题上,干得了你要交给它的活吗?
两个分数之间没有换算公式。真实的例子:两个模型排行榜只差 2 分,在使用者自己的判断类题目上差了 20 分——差距全出在榜单不考的地方。这就是转向:部署以验收结束,不以安装结束。 没考过自己的题,你不知道它接不接得住你的活;而接不住的活交出去,错的成本由你担。
LOCAL LLM / 02
二、怎么出题:五条规矩
① 按岗位分级,不打总分。 把题按用途分层:基础题(常识、语言)、粗活题(总结、翻译、整理)、专业题(用你的资料回答)、边界题(它该不该替你拿主意)。一个模型完全可能"粗活能干、判断不能碰"——总分会把这条最有用的信息抹平。
② 机器能判的,不劳人判。 字数、格式、算术题,写死标准答案对照;人只判必须由判断力判的部分。
③ 防泄漏。 给模型的材料里不能藏着答案,否则量出来的是抄写能力。
④ 同题跑三遍,一次越界就不算过。 模型的输出有随机性,一次答对可能是运气;边界题(会不会编造出处、会不会替你做决定)尤其要三遍全过——偶尔守住不算守住。
⑤ 最好的题来自真实使用。 每次它答错、编造、越界,把那一次的问题存进题库。用三个月,你会有一套市面上买不到的、专属你岗位的考卷——换模型、升级版本时,拿它一考,高下立判。
LOCAL LLM / 03
三、必考的一题:它会不会编
所有本地模型(云端也一样)都会编:编数据、编出处、编它不知道的细节。验收时必须专门考:问它资料里没有的东西,看它说"没找到"还是流利地编一段。前一篇说过,不会说"没找到"的系统比没有系统更危险——这一题不过,别让它碰任何需要准确性的活。
LOCAL LLM / 04
四、维护三规矩
考过了,上岗。让它长期不糊,三条规矩:
—换代看题库,不看新闻。 新模型发布不用追;每季度拿你的题库考一次新旧两代,分数说了算—资料库勤更新,索引跟着重建。 资料变了索引没变,它引用的就是旧版——检索层的"糊"最隐蔽—记录每次翻车。 翻车记录既是题库的来源,也是你判断"该换模型还是该改用法"的唯一依据
LOCAL LLM / 05
五、系列收口
六篇合在一起是一条完整的路:想清楚买什么(一)→ 算清楚跑多大(二)→ 挑对模型(三)→ 接好五层(四)→ 喂进资料(五)→ 考试上岗(六)。
最后一句话收住整个系列:本地大模型是你雇进家门的员工,不是你买回来的电器。 电器插电就用;员工要面试、要培训、要考核、要管理——但也只有员工,能学会你的活,守你的规矩,替你干电器干不了的事。