LOCAL LLM / DEPLOY GUIDE27 SEP 2026
装起来:模型只是乐谱
还差一个乐队
第三篇教会了挑模型。很多人在这一步栽第一个跟头:模型文件下载完,发现它根本"打不开"。
下载了几百 G 的模型文件,双击——什么都不会发生。这一篇讲清模型和"让模型跑起来的程序"是什么关系,怎么按自己的机器选,以及出问题时怎么按层排查而不是乱试。
LAYERS 01 五层各就位才出声 |
PICK 02 按机器选运行程序 |
DEBUG 03 坏了按层找,不乱试 |
LOCAL LLM / 01
一、五层结构:谁负责出声
模型文件是乐谱——几百 G 的数字,自己不会响。让它响,需要一整个乐队,从下往上五层:
—计算层(演奏技巧):把矩阵乘法跑在你这块芯片上的底层库——苹果芯片是 MLX,英伟达是 CUDA—调度层/运行程序(指挥):装载模型、管理请求、开一个本地"窗口"让别的程序来问
这就是转向:"部署"这个词的实质,是把这五层接对——而不是把乐谱下载下来。第五层你已经会挑了,操作系统和硬件是现成的,真正要做选择的只有第四层:运行程序。
LOCAL LLM / 02
二、运行程序怎么选
按动手意愿从低到高:
—LM Studio:图形界面,点鼠标就能下载模型、开始聊天——第一次跑通,选它,五分钟见到第一个字—Ollama:命令行一行装、一行跑,适合想让其他程序调用模型的人—llama.cpp:一切的底层引擎,最灵活也最裸,适合想看清每个环节的人—MLX 系(苹果芯片):苹果官方计算框架上的运行方案,在统一内存机器上效率最好——苹果大内存机器认真用,最终会走到这里
建议路径:先用图形界面的跑通第一次对话(确认五层没问题),再按需要换更工程化的方案。跑通永远优先于跑好。
LOCAL LLM / 03
三、坏了怎么修:按层找,不乱试
部署后总会遇到"突然不行了"。乱试是最费时间的修法;正确做法是从下往上按层问:
—系统层:系统刚升级过吗?(底层接口变了,计算层可能要跟着更新)—计算层/调度层:运行程序的版本和模型格式匹配吗?日志里说什么?——日志永远比猜测诚实,报错原文拿去搜索,九成的坑别人踩过
一个真实案例:一次系统大版本升级后,模型服务起不来——按层排查,问题出在第三层的加速库需要随系统更新,五层里只有这一层要动。知道问题在哪一层,修起来是十分钟;不知道,是一下午。
LOCAL LLM / 04
四、验收这一步
装完的标准不是"程序打开了",是完整跑通一问一答:问它一道你知道答案的题,看到回答逐字出现。顺手记下每秒字数——和第二篇算的理论值对一下,差在三到五成属正常,差一个数量级说明有一层没接对。
下一篇,让它读你自己的资料——这是本地部署从"玩具"变"工具"的那一步。