← 脑科学 × AI目录

脑科学与AI 15|背熟了所有答案,还是成不了师傅

BRAIN / BRAIN × AI20 SEP 2026

脑科学与AI⑮|背熟了所有答案,还是成不了师傅

上一篇的边界条款里埋了一句话:蒸馏和微调能把大模型的行为复制个大概,但复制的是行为不是结构,走样的部分恰好集中在最难的判断上。有读者该追问:为什么走样偏偏堆在最难处,而不是均匀地差一点?这一篇把这个"恰好"讲清楚——它不是巧合,是三条机制共同指向的必然。

模仿复制的是"他会说什么",不是"他为什么这么说"。所以走样不是均匀的打折,而是有形状的:示范越密的地方学得越像,结构越深的地方错得越狠——"平均分接近"和"关键处等效",是两回事。

3

01

条机制把走样堆到难题上

2

02

分与 20 分:榜单差距与判断差距

1

03

条出路:考卷里放没见过的题

模仿的走样有形状:常规题上几可乱真,难题上裂开。因为学到的是答案的分布,不是出答案的结构。

BRAIN / 01

一、先说清蒸馏和微调是什么

两个词,一个意思的两种做法。

蒸馏:让小模型大量观摩大模型的答案,把自己拧到"输出尽量像老师"。老师是谁不重要,重要的是学生从头到尾只看得到答案——老师内部那几千亿个参数长什么形状,学生看不到,也装不下。

微调:在一个现成模型上,用几千几万条示范继续拧旋钮,让它染上某种行为倾向——某个领域的口吻、某种格式、某类任务的套路。

共同点:都是对着行为学,不是对着结构学。 用师徒打比方:徒弟把师傅一万个案例的处置背得滚瓜烂熟——他学到的是"师傅在这些情形下会怎么做",不是师傅脑子里那套长了三十年的接线。

BRAIN / 02

二、为什么走样恰好堆在难题上:三条机制

第一条:示范的密度不均。 模仿的精度跟示范的密度走。常规问题在训练材料里出现千百遍,学得密不透风;真正难的判断——罕见情形、多因素权衡、没有先例的组合——恰恰是示范最稀的地方。模仿在你最需要它的地方,材料最少。

第二条:同一个答案,可以来自两种完全不同的结构。 一道题答对了,可能是推出来的,也可能是背出来的——行为对结构是多对一的。常规题上两者给分一样,所以模仿者可以一路高分;直到一道换了皮的新题,两种结构立刻分开:推理的照样对,背诵的对着旧皮答新题。上一篇说过验收只能靠考——这里补上下半句:考卷必须包含没见过的题,否则考不出"像"和"会"的区别。

第三条:难题的链条长,走样会复利。 浅问题一步到答案,模仿差一点就差一点;难判断要走十步,每一步学到的都是九成像,十步下来只剩三成——长链条把小走样放大成大偏差,而"难"的定义恰恰就是链条长。 三条机制指向同一处:走样不是随机分布的,它精确地堆在示范最少、结构最深、链条最长的地方——难判断。

BRAIN / 03

三、一组实测,正好是它的注脚

我们此前测过两个开源模型:第三方排行榜总分只差 2 分;换成自己出的判断类题目,一个 88 分、一个 68 分(满分 110)。差距全出在榜单不考的地方——数字有没有依据、边界有没有说明、有没有越权替提问者做决定。

现在可以给这个现象一个机制解释:排行榜考的大多是示范密集区,正是模仿学得最像的地方;判断题考的是链条深处,正是走样堆积的地方。 所以"小模型追平大模型"的新闻,先问追平的是哪类题——常规题追平是模仿的本性,几乎必然发生;判断题的差距才是两个模型之间真实的距离。能力在扩散,但扩散的速度按层分:行为层最快,判断层最慢。

BRAIN / 04

四、人这边,一模一样

把主语换成人,这三条机制一条不改。

背熟了大师全部棋谱的人成不了大师——棋谱是行为记录,大师的价值在棋谱没记下的地方:为什么不走那步。手艺行当里所谓"只可意会"的部分,恰好是示范最少、结构最深的部分——师傅自己也说不出来,因为那不是他"知道"的一条条规则,是他长成的接线(上一篇讲过:知识不是存进去的)。所以真师承从来不是抄答案,是在师傅看着的情况下自己做题、做错、被纠正——用自己的错误把结构一凿一凿刻出来。学一个大师,背他的结论是最快的路,也是停在"像"的路;重走他的判断,才是慢而唯一通往"会"的路。

BRAIN / 05

五、边界

两处不要说过头。一,蒸馏在它的适用区里是效率极高的好工具——常规任务本来就不需要"会","像"就够了,用九牛二虎去追求结构等效反而是浪费;二,"难判断学不来"说的是靠模仿学不来,不是不可学——加上推理过程的示范(不只给答案、也给打草稿的路径)能把走样往深处推一截,这正是当前训练方法演进的方向之一,但"看别人打草稿"与"自己打草稿"之间,仍隔着本篇说的全部三条机制。

BRAIN / 06

六、三行,留着复习

```

模仿学的是答案分布 "他会说什么"≠"他为什么这么说";行为对结构是多对一

走样有形状 堆在示范最稀、结构最深、链条最长处——恰好是难判断

考卷要有没见过的题 常规题上"像"与"会"同分;平均分接近≠关键处等效

```

本篇是「脑科学 × AI」系列第 15 篇,属个人学习与判断笔记,展开第 13 篇边界条款里的一句话。"三条机制"(示范密度、多对一、链条复利)是我对公开常识的组织与推论,不是某一篇论文的结论;师徒与棋谱为类比。第三节实测为单一环境、自建题库的小样本,模型已匿名,不构成对任何产品的评价。不构成任何投资建议。

阅读依据:蒸馏(distillation)与微调(fine-tuning)的机制表述为该领域教科书级常识;"带推理过程的示范能改善模仿质量"为当前公开的训练方法方向,均按常识级处理、未回一手论文逐条核对。第三节数字(第三方综合分差 2 分、自建判断题 88 对 68 分)来自 2026-09-27 本机三模型对比实测(单一环境、有限题量)。"知识是长成的接线"见本系列第 14 篇;"验收只能靠考"见第 14 篇;"能力扩散"的讨论承接第 13 篇。