← 返回概念解读

Concept Fable精修版

预填充

Prefill Phase · Inference

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

书记先读完整卷,第一句批示才有根据

总督府每天清晨收到厚案卷,附着旧判、地契和来往文书。新总督嫌幕僚迟迟不落笔,命令谁先写出第一句批示便受赏。

结果有人只看首页就下结论,后面夹着的旧判常把前面的判断推翻。幕僚长解释,第一句之前的沉默不是偷懒,而是在把整卷材料读进心里,整理成随手可查的底稿。

他规定先集中通读共用的前情和附件,再起草批示。相同类型的案子可复用已有的索引;材料过长时,也要谨慎删减,不能为了快而扔掉决定性的证据。

首句批示仍需等待,但后续的行文快而连贯。长上下文的成本往往发生在开口之前,准备得越完整,后面逐字推进越顺。

概念落点

这个故事讲的是:预填充

预填充阶段是推理刚开始时,模型先并行处理全部输入 token,并建立 KV 缓存的阶段。它发生在逐 token 解码之前,通常会显著影响首 token 时间。

长提示词、RAG 检索上下文、系统指令和 Agent 状态越大,预填充成本越明显。前缀缓存、提示词压缩、分块预填充和调度策略,都可以降低或平滑这部分开销。

故事对应

  • 请愿书和附件:input prompt, retrieved context, tool state and history
  • 读完整卷:processing input tokens during prefill
  • 第一句批示:first generated token
  • 索引和底稿:KV cache populated by prefill
  • 相同政策提前读:prefix/prompt caching
  • 切掉材料风险:unsafe prompt compression or context pruning
  • 最后洞察:Prefill Phase 是首 token 前的输入处理成本,长上下文应用必须显式管理它

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

KV cachedecodingprompt processingfirst-token latency

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。