← 返回概念解读

Concept Fable精修版

知识蒸馏

Knowledge Distillation · Training and Inference

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

大厨写给小灶的火候谱

王府有位大厨,能凭一口汤判断盐、火、骨和水的比例。可他只有一个人,每顿宴席都等他,客人越多,厨房越慢。

管家先让小灶厨子背菜单。红烧就是红烧,清蒸就是清蒸。小厨子很快会报菜名,却不知道为什么这锅该早三息出火,那锅该多留半勺汤。

有人提议把大厨每道菜的最终评价抄下来:好、一般、差。小厨子照着练,仍学不到细微差别。

大厨于是写火候谱:每一步闻到什么味,颜色变到哪里,为什么不用更猛的火,相近两种做法各差几分。小厨子学答案,也学取舍。

一段时间后,小灶做不出王府最难的全席,却能稳定完成八成常见菜。它出菜快,占地方小,夜里也能开火。

管家没有撤掉大厨。他安排试菜席,专测忌口、稀有食材、急单和临时改口。结果写清:小灶适合日常宴席,不适合国宴主菜。厨房把大厨的能力压成小灶能承受的形状,同时留下边界。

小灶厨子最怕被拿去做国宴。管家把边界贴在灶台旁:常见宴席、固定菜单、夜间加餐可以接;稀有贵客、过敏复杂、礼制主菜必须请大厨。

这种安排让厨房不再把强手困在小活里,也不把小灶推向它承受不了的场面。火候谱越更新,小灶越稳;边界越清楚,客人越少为省钱付出代价。 后来新手入门时,老师傅不再先讲抽象名目,而是让他们复盘那次失误:原先哪里靠直觉,第一次修补为什么不够,新的安排怎样把风险留在能检查的位置。等他们能说清这些细节,还能指出什么时候该沿用、什么时候该升级,才算真正懂了这套办法。 后来他们还把这套办法交给新人演练:先让新人按旧办法做一遍,看错误怎样出现;再按新规矩重做,看哪一步被提前拦住,哪一步留下了证据。新人若只会背名字,仍会在相似场景里乱用;只有能说出适用边界、代价和失败后的补救,才被允许独立接活。

揭示

这个故事讲的是:知识蒸馏

Knowledge Distillation 是让较小的 student model 学习较大 teacher model 行为的方法,通常通过模仿输出分布、推理步骤或中间表示来保留能力并降低推理成本。企业落地中,它常用于把昂贵大模型的能力压缩到可本地部署、低延迟或低成本的模型上,但需要用评测确认哪些能力被保留、哪些边界被牺牲。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 大厨:能力强但昂贵、慢或难部署的大模型
  • 小灶厨子:更小、更便宜、更易部署的学生模型
  • 只背菜名:简单标签训练,信息太粗
  • 火候谱:teacher 的软输出、解释或行为轨迹
  • 试菜席:蒸馏后的回归评测
  • 不能做满汉席:小模型能力边界和取舍

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

teacher modelstudent modelcompressionfine-tuningsynthetic data