← 返回概念解读

Concept Fable精修版

推测解码

Speculative Decoding · Inference

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

大法官让快书记先写草案

府衙判牍积压,大法官审得准,却慢;快书记写得快,却常有小错。过去每份判词都等大法官逐字写,堂外队伍越排越长。

县令想让快书记单独写判词。试了三天,轻案还行,复杂案便错漏百出。大法官若事后全改,反而更累。

老师爷提出折中。快书记先沿着案情草拟接下来几句,大法官不等他写完全篇,而是边看边验:对的几句直接盖小印,错的地方退回重写,从错处重新接上。

一开始快书记猜得太远,错一处就废一大片。师爷限制他每次只预写几句,并让他专挑常见格式:案由、证据、量罚。大法官专心验这些草稿,比从白纸写起快得多。

遇到简单案,快书记连续几句都被接纳,判牍飞快;遇到复杂案,大法官会早早打断,亲自慢审。速度来自猜得准时的批量通过,安全来自大法官仍握着最终判断。

师爷提出折中:让快书记先写草稿,大法官只负责逐句验收。若前几句都合格,就直接盖进判牍;一旦某句不稳,后面草稿全退回,由大法官从那里重写。

刚开始快书记写得太放,大法官退得更多,速度并没上来。后来快书记只抢写自己把握大的常规句,复杂转折留给大法官。队伍终于短了:容易的字句被提前铺好,最终仍由准的人确认。快不替代准,快只是先试探一段可用的路。堂外百姓只觉得判牍来得快了,却不知道里头多了一道验收。草稿若被接纳,就省下时间;草稿若不可靠,马上丢弃。速度来自可验证的提前量。

府衙后来明白,慢而准的人不一定只能独自慢写。让快手先探路、准手并行验收,猜对就省时,猜错就回退。关键是快手不能越权定案,准手也不能放弃逐段验印。

揭示

这个故事讲的是:推测解码

Speculative Decoding uses a smaller or faster draft model to propose multiple candidate tokens, then lets the larger target model verify them in parallel. Accepted tokens speed up generation without changing the target model’s output distribution when implemented correctly. It reduces decode latency when the draft model is cheap and accurate enough, but poor acceptance rates can erase the gain.

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 大法官:target model
  • 快书记:draft model or assistant model
  • 草案句子:speculative candidate tokens
  • 一次盖过好几句:parallel verification and token acceptance
  • 中间某句不对:rejection and fallback to target model decoding
  • 草案命中率:acceptance rate
  • 最后洞察:Speculative Decoding 用便宜模型提前猜,再由强模型验证,在质量不降的前提下降低生成延迟

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

draft modeltarget modelverificationlatency reduction

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。