LOCAL LLM / DEPLOY GUIDE27 SEP 2026
你的电脑
能跑多大的模型
系列第一篇说清了为什么装。动手之前,先回答两个问题:我的电脑装得下多大的模型?装下之后,它能跑多快?两个问题各对应一道算术。
两道小学算术,决定你能装多大的模型、它能跑多快。这一篇把选硬件和选模型尺寸的账一次算清——结论可能颠覆直觉:卡脖子的不是算力,是内存。
FIT 01 装多大=参数×字节 |
SPEED 02 跑多快=带宽÷搬运量 |
QUANT 03 量化:一件事省两头 |
LOCAL LLM / 01
一、装多大:一道乘法
模型的本体是一大堆数字(参数)。名字里的 7B、70B、400B,就是 70 亿、700 亿、4000 亿个参数。每个参数要占字节,模型运行时要整个装进内存——所以:
占内存 ≈ 参数量 × 每个参数的字节数。
每个参数占多少字节,取决于"量化"——把数字存粗一点的压缩技术:
—不量化(16 位):每参数 2 字节 → 70B 模型要 140G—8bit:每参数 1 字节 → 70B 要 70G—4bit:每参数半字节 → 70B 只要 35G(质量损失很小,是本地部署的默认选择)
对照自己的内存就有了答案:16G 内存跑 7B 级,64G 跑 30B 级,128G 能碰 70B 级,几百 G 才装得下 400B 级的旗舰开源模型。内存,是本地大模型世界的入场券面额。
LOCAL LLM / 02
二、跑多快:一道除法
装下了,多快?大模型写答案是逐字生成的,而每写一个字,都要把这一步用到的参数从内存里完整搬运一遍。于是:
每秒字数上限 ≈ 内存带宽 ÷ 每字搬运量。
一个实例:一台内存带宽约 819G/s 的工作站,跑一个每字动用 400 亿参数的 4bit 模型(400 亿 × 0.5 字节 ≈ 每字搬 20 多 G),理论上限约每秒 37 字,实测约 19 字——实测通常只有理论值的三到五成,其余耗在额外开销上,但数量级由这道除法定死。
这就是转向:家用机跑大模型,决定成败的不是算力,是内存的容量和带宽。 容量决定门票,带宽决定速度;显卡再强,参数搬不过来也只能等。这也解释了为什么带统一内存的机器成了本地部署的热门——内存大、带宽高,两道算术都占优。
LOCAL LLM / 03
三、两个省钱的推论
推论一:量化一件事省两头。 4bit 让模型占的内存少四分之三,同时让每个字的搬运量也少四分之三——又装得下,又跑得快。所以下载模型永远优先找 4~6bit 的量化版。
推论二:"每字动用"不等于"总大小"。 新一代大模型多用"专家混合"结构:总参数几千亿,每个字只唤醒其中一小撮。这种模型占内存按总量算(乘法),跑速度按激活量算(除法)——大而省,是它统治大模型的原因。看模型名字里的 A 多少 B(第三篇细讲),就是在看这个激活量。
LOCAL LLM / 04
四、动手前的自查
拿你的电脑对三个数:①内存多大 → 定模型档位;②内存带宽多少(机器规格表里查得到)→ 预估每秒字数;③硬盘留没留够(模型文件几十到几百 G)。三个数抄下来,下一篇挑模型时直接用。