← 返回概念解读

Concept Fable精修版

草稿模型

Draft Model · Serving optimization

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

快写学徒先递草稿,老书记只盖能盖的章

县衙有位老书记,判词写得稳,可每次只写一句。案卷多起来后,百姓排到院外,大家都知道他准,也知道他慢。

县令请来一个快写学徒。学徒不负责最终判词,只在旁边根据案情先写几句可能的后文,递给老书记查看。最初县令让学徒写得越多越好。桌上草稿铺满,老书记核对不过来,很多草稿因为开头就偏了,只能整张废掉。

后来他们定了规矩:学徒必须很快,文风要接近老书记,草稿长度适中;老书记一次检查一段,能接受几句就收几句。学徒猜得准时,老书记像跨过几级台阶;猜得不准时,老书记从第一个错字处继续亲自写,最终判词仍以他的判断为准。

账房发现,学徒太弱会浪费核对,学徒太大又省不了成本。最合适的是便宜、快、足够相似,但不需要和老书记一样强。

县衙也给每种案子记录接受率。格式固定的公文草稿常被收下,复杂争议则很少通过,说明不是所有请求都适合让学徒先跑。

老书记随后给学徒立了规矩:草稿短一点,先猜最可能的几句;老书记只要看见第一句偏了,就整段放下,不再硬改。学徒也学会观察老书记的笔势,把常见案由先铺好,把容易误判的地方留空。队伍移动得快了,判词仍由老书记最后落笔。

这次小事故让众人停下来复盘。他们没有急着换一套更响亮的说法,而是把出错的入口、被误解的规则和需要保留的边界逐一写清。

县衙的人后来明白,快写学徒的价值不在替老书记判案,而在提前递上可被迅速采纳或丢弃的候选句。县令最后明白,草稿者的职责不是替代权威,而是在权威确认前低成本探索下一段可能,让昂贵判断少重复走路。

揭示

这个故事讲的是:草稿模型

草稿模型是推测解码中较小或更快的模型,用来先提出一串候选 token。随后目标大模型负责验证这些候选,只接受符合自己分布的前缀。

草稿模型要足够快,也要和目标模型足够接近。若候选经常被拒绝,验证开销会抵消加速收益;若接受率高,整体解码速度就可能明显提升。

隐喻映射

  • 快写学徒:draft model
  • 老书记:target model
  • 草稿后文:candidate tokens
  • 老书记盖章:verification and acceptance
  • 接受率:acceptance rate in speculative decoding
  • 太弱或太大都不划算:draft model quality-speed tradeoff

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

speculative decoding

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。