← 脑科学 × AI目录

脑科学与AI 18|模型里的"专家",不是你以为的专家

BRAIN / BRAIN × AI20 SEP 2026

脑科学与AI⑱|模型里的"专家",不是你以为的专家

第 12 篇说,专家混合结构像个配菜员,每道菜只取要用的部位;第 14 篇又说,模型是纯弥散的,知识没有地址。细心的读者会停在这里:"专家混合"听起来明明就是分区——这两篇是不是打架了? 这一篇专门回答这个问题。答案顺带揭开一个更普遍的坑:AI 术语里的人类词汇,经常名不副实。

把"分区"拆成两个维度就解开了:稀疏(干活时用不用全体)和可定位(知识住哪指不指得出)是两回事。MoE 学到了脑的稀疏,没学到脑的分区——它的"专家"有分区的形状,没有分区的语义。一句话:抄到了省电法,没抄到地址簿。

2

01

个维度:稀疏 · 可定位

1

02

项惩罚:负载均衡,强制别分工太清楚

0

03

个语义锚:专家没有专属的输入输出

稀疏与可定位是两个维度:稠密模型两样都无,MoE 只有稀疏,脑两样都有。"专家"是流水线上的均匀分工,不是医院里的分科。

BRAIN / 01

一、先拆开两个被混在一起的问题

问"模型有没有分区",其实是在问两件事:

第一件:干活的时候,是全体上阵还是只来一部分? 这叫稀疏。稠密模型每写一个字全体参数上阵;专家混合每字只唤醒约二十分之一;脑更是从不全脑放电。这个维度上,MoE 确实向脑靠了一大步——第 12 篇讲的就是它。

第二件:某条知识住在哪,指不指得出来? 这叫可定位。脑指得出:中风伤了某个区,丢的是对应的功能。模型指不出:第 14 篇讲过,"巴黎属于法国"不在任何一行里。MoE 在这个维度上和稠密模型一样——一无所有。

稀疏是"用多少"的问题,可定位是"住哪里"的问题。两个维度独立,MoE 只占了前一个。

BRAIN / 02

二、证据一:专家不按题材分工

打开一个真实的 MoE 看它的路由记录,你找不到"法律专家""医学专家"。公开研究里反复出现的发现是:专家的分工更多跟着表层特征走——标点、词性、词的位置这类,而不是话题;而且每一层各自路由,同一句话在第 5 层和第 50 层走的是完全不同的专家组合。

最能说明问题的是切除实验的形状:切掉脑的一个分区,丢的是一项具体功能;切掉 MoE 的一个专家,得到的是弥散的整体变笨——没有哪项能力单独消失。损伤的形状,暴露了组织的形状。

BRAIN / 03

三、证据二:它被刻意训练成"别分工太清楚"

更有意思的是第二条证据:MoE 的训练目标里,专门有一项负载均衡惩罚——如果路由把活都派给少数几个专家,就要挨罚。工程师要的是每个专家接活均匀,机器利用率才高。

想清楚这一条的方向:这是按效率均匀切,不是按意义切——它在主动阻止专家们长出清晰的专业分工。这就是转向:"专家"这个名字是工程师给的错误期待。它实际是流水线上的均匀分工,不是医院里的分科——流水线工人 A 和 B 的差别是排班表定的,不是专业定的。AI 术语里这样的词还有不少:"注意力"不是注意,"学习"不是学习,"专家"也不是专家——借人类的词起名,借的是直觉,欠的是精确。

BRAIN / 04

四、脑的分区为什么有语义

那脑凭什么做到"分区有意义"?第 3 篇给过答案:脑的分区是物理接线锚定的。 视觉皮层之所以管视觉,不是它"擅长"视觉,是它接着眼睛——分区的意义来自与真实世界传感器的硬连接,从出生起就焊死。而 MoE 的专家没有专属的输入输出,只有损失函数压力下自发长出的分流——没有锚,就锚不住意义。

BRAIN / 05

五、这个空档值得盯着

两层意义。读新闻时:凡是"MoE 模仿了大脑分区"的说法,都要打对折——它模仿的是稀疏这一半,分区那一半还空着。看趋势时:这个空档正是可解释性研究在攻的方向,而且它连着实际利益——如果哪天专家真的长出可指认的语义分工,"精确切除某项能力"就从不可能变成工程问题,第 14 篇说的"没法删"会松动,模型的合规、审计、定制都会换一个玩法。那会是一条值得注意的信号,眼下还没有出现。

BRAIN / 06

六、边界

一处别说满:实测中某些专家确实表现出微弱的模式偏好(比如对代码、数字的轻微聚集),"完全没有语义"说过头了——准确的说法是远未达到"损伤定位"级别的分工。本篇依据的是公开研究里的常见发现,属领域通行认识,未逐篇核对一手论文,结论按此打折使用。

BRAIN / 07

七、三行,留着复习

```

分区拆成两维 稀疏=用多少(MoE 有);可定位=住哪里(MoE 无)

专家不是专家 路由跟浅层特征走+负载均衡强制均匀——流水线分工,不是医院分科

锚定才有语义 脑的分区焊在传感器上;没有锚的分流,锚不住意义

```

本篇是「脑科学 × AI」系列第 18 篇,属个人学习与判断笔记,回答⑫与⑭之间一个真实的读者疑问。"流水线与医院分科""借直觉欠精确"为我的类比与判断;第六节已声明:个别专家存在微弱模式偏好,"完全无语义"说过头,本篇结论按"远未达损伤定位级别"使用。不构成任何投资建议。

阅读依据:MoE 专家分工偏向表层特征(标点、词性、位置)、逐层独立路由、负载均衡损失为公开 MoE 研究文献中的通行发现,属领域常识级表述,本篇未逐篇核对一手论文;"脑分区由物理接线锚定"见本系列第 3 篇(及其所引 Cell 2026 连接组,PMID 42691995);"知识无址、没法删"见第 14 篇;"每字唤醒约二十分之一"沿用第 12 篇实测口径(单一环境)。