BRAIN / BRAIN × AI20 SEP 2026
脑科学与AI⑮|背熟了所有答案,还是成不了师傅
上一篇的边界条款里埋了一句话:蒸馏和微调能把大模型的行为复制个大概,但复制的是行为不是结构,走样的部分恰好集中在最难的判断上。有读者该追问:为什么走样偏偏堆在最难处,而不是均匀地差一点?这一篇把这个"恰好"讲清楚——它不是巧合,是三条机制共同指向的必然。
模仿复制的是"他会说什么",不是"他为什么这么说"。所以走样不是均匀的打折,而是有形状的:示范越密的地方学得越像,结构越深的地方错得越狠——"平均分接近"和"关键处等效",是两回事。
3 01 条机制把走样堆到难题上 |
2 02 分与 20 分:榜单差距与判断差距 |
1 03 条出路:考卷里放没见过的题 |
模仿的走样有形状:常规题上几可乱真,难题上裂开。因为学到的是答案的分布,不是出答案的结构。
BRAIN / 01
一、先说清蒸馏和微调是什么
两个词,一个意思的两种做法。
蒸馏:让小模型大量观摩大模型的答案,把自己拧到"输出尽量像老师"。老师是谁不重要,重要的是学生从头到尾只看得到答案——老师内部那几千亿个参数长什么形状,学生看不到,也装不下。
微调:在一个现成模型上,用几千几万条示范继续拧旋钮,让它染上某种行为倾向——某个领域的口吻、某种格式、某类任务的套路。
共同点:都是对着行为学,不是对着结构学。 用师徒打比方:徒弟把师傅一万个案例的处置背得滚瓜烂熟——他学到的是"师傅在这些情形下会怎么做",不是师傅脑子里那套长了三十年的接线。
BRAIN / 02
二、为什么走样恰好堆在难题上:三条机制
第一条:示范的密度不均。 模仿的精度跟示范的密度走。常规问题在训练材料里出现千百遍,学得密不透风;真正难的判断——罕见情形、多因素权衡、没有先例的组合——恰恰是示范最稀的地方。模仿在你最需要它的地方,材料最少。
第二条:同一个答案,可以来自两种完全不同的结构。 一道题答对了,可能是推出来的,也可能是背出来的——行为对结构是多对一的。常规题上两者给分一样,所以模仿者可以一路高分;直到一道换了皮的新题,两种结构立刻分开:推理的照样对,背诵的对着旧皮答新题。上一篇说过验收只能靠考——这里补上下半句:考卷必须包含没见过的题,否则考不出"像"和"会"的区别。
第三条:难题的链条长,走样会复利。 浅问题一步到答案,模仿差一点就差一点;难判断要走十步,每一步学到的都是九成像,十步下来只剩三成——长链条把小走样放大成大偏差,而"难"的定义恰恰就是链条长。 三条机制指向同一处:走样不是随机分布的,它精确地堆在示范最少、结构最深、链条最长的地方——难判断。
BRAIN / 03
三、一组实测,正好是它的注脚
我们此前测过两个开源模型:第三方排行榜总分只差 2 分;换成自己出的判断类题目,一个 88 分、一个 68 分(满分 110)。差距全出在榜单不考的地方——数字有没有依据、边界有没有说明、有没有越权替提问者做决定。
现在可以给这个现象一个机制解释:排行榜考的大多是示范密集区,正是模仿学得最像的地方;判断题考的是链条深处,正是走样堆积的地方。 所以"小模型追平大模型"的新闻,先问追平的是哪类题——常规题追平是模仿的本性,几乎必然发生;判断题的差距才是两个模型之间真实的距离。能力在扩散,但扩散的速度按层分:行为层最快,判断层最慢。
BRAIN / 04
四、人这边,一模一样
把主语换成人,这三条机制一条不改。
背熟了大师全部棋谱的人成不了大师——棋谱是行为记录,大师的价值在棋谱没记下的地方:为什么不走那步。手艺行当里所谓"只可意会"的部分,恰好是示范最少、结构最深的部分——师傅自己也说不出来,因为那不是他"知道"的一条条规则,是他长成的接线(上一篇讲过:知识不是存进去的)。所以真师承从来不是抄答案,是在师傅看着的情况下自己做题、做错、被纠正——用自己的错误把结构一凿一凿刻出来。学一个大师,背他的结论是最快的路,也是停在"像"的路;重走他的判断,才是慢而唯一通往"会"的路。
BRAIN / 05
五、边界
两处不要说过头。一,蒸馏在它的适用区里是效率极高的好工具——常规任务本来就不需要"会","像"就够了,用九牛二虎去追求结构等效反而是浪费;二,"难判断学不来"说的是靠模仿学不来,不是不可学——加上推理过程的示范(不只给答案、也给打草稿的路径)能把走样往深处推一截,这正是当前训练方法演进的方向之一,但"看别人打草稿"与"自己打草稿"之间,仍隔着本篇说的全部三条机制。
BRAIN / 06
六、三行,留着复习
```
模仿学的是答案分布 "他会说什么"≠"他为什么这么说";行为对结构是多对一
走样有形状 堆在示范最稀、结构最深、链条最长处——恰好是难判断
考卷要有没见过的题 常规题上"像"与"会"同分;平均分接近≠关键处等效
```