← 返回概念解读

Concept Fable精修版

自回归解码

Autoregressive Decoding / Decode Phase · Inference

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

接龙诗会每一句都要接在上一句后面

湖边书院每晚办接龙诗会。第一句由主持人给出,后面每位诗人只能根据前面所有句子,接出下一句。短诗时,这种玩法很雅。

后来题目变长,旁边还放着典故、韵脚、客人要求和禁句。每接一句,诗人都要看清此前的脉络,速度越来越慢,等候的人也越来越多。

院长先让诗人提前背典故,又把纸笔换得更好。可接龙的规矩没变:下一句必须等上一句出现,不能十句同时写完。准备可以提前,落笔仍要排队。

有人建议一口气写完整首。几次之后,韵脚乱了,人物前后矛盾,结尾还接不上开头。大家才知道,这种诗必须逐句承接,抢跑只会让后面的句子失去来处。

记录员开始保存每句已经形成的线索。诗人接下一句时,不再重新整理所有典故,只用这些记录和最新一句继续判断。书院确实快了一些。

即便如此,每一步仍有固定成本:取线索、想下一词、落笔、把新线索写回记录。诗越长,记录越厚,同时来的诗会越多,书院越拥挤。

院长这才把诗会分成两个阶段看:开场读题可以多人并行准备,真正接龙时却一句一句推进。两个阶段的瓶颈不同,不能用同一种办法催。

后来书院评估速度,不再只问题目读得快不快,还专门看接龙时每一息能接多少字、每一步有没有空等。慢的根子藏在顺序里,能改的是记录、排队和旁人预先试探的方式。书院还发现,越到后半首,前面留下的线索越珍贵,也越占地方。若记录散乱,诗人会反复翻找;若记录太省,又会忘掉关键伏笔。接龙的快慢,常常被这些细小步骤一点点拖住。有些客人催得急,院长也只敢在旁边多备候选句,不能把顺序拆掉。因为一旦上一句变了,后面所有预想都要跟着改。后来复盘时,众人把这条经验写进日常规矩:先看现场哪里真正改变了结果,再决定该保留什么、修补什么、限制什么。

揭示

这个故事讲的是:自回归解码

自回归解码,也就是 Decode Phase,是大模型处理完输入之后逐个生成 token 的阶段。每生成一个新 token,都要依赖前面已经生成的内容,所以它天然有顺序依赖,不能像批量读输入那样完全并行。

KV Cache 可以避免反复重算历史上下文,但下一个 token 仍要等上一个 token 出来。服务性能里的每秒 token 数、总生成延迟、连续批处理和投机解码,很多都围绕这个阶段优化。

隐喻映射

  • 接龙诗会:autoregressive token generation
  • 上一句决定下一句:causal dependence between tokens
  • 开场读题:prefill phase
  • 保存线索:KV cache
  • 每步取线索再写回:decode step using and updating cache
  • 不能十句同时写完:sequential nature of autoregressive decoding
  • 最后洞察:Decode Phase 是逐 token 的热路径,优化重点在缓存、调度、投机和每步计算成本

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

prefillKV cachetoken generationlatency