← 返回概念解读

Concept Fable精修版

Medusa

Medusa · Inference

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

书院给主笔添了几支会预想的副笔

山城书院里,主笔先生每天替县里写回信。他写得稳,错字少,可每次只肯落下一笔,学生们围在桌边等下一句,队伍越排越长。

院长先请来一名快手学徒,让他提前写草稿,主笔只负责挑对的句子。学徒速度很快,可有时语气跑偏,主笔核对草稿也要花心力。

有人建议再请三名学徒,各写一版。桌上草稿堆得像小山,主笔还没开始批,院长已经分不清哪张纸是谁写的,省下的时间又被整理吃掉。

后来一位刻版师提出另一种办法:不另设一张桌子,而是在主笔自己的笔架上加几支副笔。主笔写当前字时,副笔顺手猜后面几字,仍由主笔本人一次性验收。

副笔不是独立先生,也不单独改文章。它们只是从同一个主笔的习惯里分出几个预测方向,提前把可能的后续摆在桌面上。

一开始副笔常猜错,主笔就只收下前面正确的部分,把错的划掉继续写。猜得准时,一次就能推进好几字;猜得不准,也不会改变最终信件的意思。

书院终于不用在外面维持一支草稿队伍。信仍由主笔定稿,副笔只负责把下一小段的可能性摊开,让主笔少走几次重复的抬手落笔。

院长这才看清,快并不一定来自另一个更小的作者。有时是在同一位作者身上增加可验证的并行预想,让慢的确认动作一次覆盖更多未来。后来主笔给副笔定了规矩:只能从当前句势往后猜,不能另起议论;主笔确认到哪里,信就推进到哪里。副笔若连续猜偏,就先收起,免得桌面太乱。学生们这才明白,副笔的本事不在于替主笔做主,而在于把可能正确的后续提前摆好,让确认这件慢活少重复几次。后来院长发现,副笔数量也不能贪多。桌上预想太拥挤,主笔反而慢。能被快速验收的少数猜测,才真正省时间。猜测要能被快验,才配留在桌上。

揭示

这个故事讲的是:Medusa

Medusa 是一种推测解码方法:在基础模型上加多个解码头,让这些头并行预测未来 token,再由基础模型验证哪些可以接受。

它和经典投机解码的区别是,不需要另接一个独立草稿模型,因此部署可能更简单。只要并行预测的 token 接受率足够高,就能降低解码延迟。

隐喻映射

  • 主笔先生:base / target model
  • 副笔:Medusa 的多个 decoding heads
  • 提前猜后面几字:parallel candidate token prediction
  • 主笔一次性验收:verification by the base model
  • 不用另设草稿队伍:不需要单独 draft model
  • 猜错就划掉:未通过验证的候选不会改变最终输出

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

speculative decodingparallel decodingdrafting heads