← 返回概念解读

Concept Fable精修版

预填充

Prefill · LLM inference

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

说书人开口前,先把整卷旧案铺满桌面

茶馆有位说书人,客人问一句,他就能接着讲。短故事时,他几乎立刻开口,像是早就知道答案。

后来客人带来厚厚旧案,让他说书人先读完再判断。说书人迟迟不开口,茶客以为他变慢了。

掌柜催他边读边讲。结果前半段讲得热闹,后半段才发现关键线索在卷尾,前面的判断全要推翻。

说书人解释,开口之前必须先把旧案读进脑中,理清人物、时间和线索。只有这样,后面每吐出一个字时才不必重新翻整卷。

掌柜于是把等待分成两段记账:先读卷,后说书。读卷阶段耗时取决于旧案长度;说书阶段则是一字一字往外吐。

茶馆还学会提前整理常用旧案。常问的案子先铺好,客人来了就能更快进入说书阶段。

后来,大家不再把所有延迟混成一团。长上下文慢在哪里、缓存能省哪里、并发会堵在哪里,都看得清楚。

说书人说,回答慢不一定慢在生成答案,有时慢在第一句话之前那次完整的上下文消化。后来,又来了一件更棘手的活。表面看只是旧问题放大,实际把藏在流程里的缝隙都逼了出来:谁先接手、谁能改动、出了错怎样回到上一步,过去靠熟人默契混过去的地方,现在都必须说清楚。主事人没有再催大家更用心,而是把现场重新走了一遍。他让人记录每次交接、每次失败和每次补救,哪些地方只是慢,哪些地方会误伤结果,哪些地方一旦错了就很难追回。新规矩推开后,最初几天并不顺手。有人嫌多了一道检查,有人觉得旧经验被冒犯。可当下一次异常出现时,大家第一次能沿着痕迹找到问题发生的位置,而不是围着结果互相猜。这套办法没有让现场变得神奇,只是让责任、边界和回头路都清楚起来。能自动完成的继续自动完成,需要人判断的地方停下来确认,真正危险的动作不再混在普通动作里一起放行。

揭示

这个故事讲的是:预填充

Prefill 是 LLM 推理中处理输入 prompt/context 并构建初始 KV cache 的阶段。它发生在模型生成第一个 token 之前,计算量通常随输入长度增长。理解 prefill 有助于分析 TTFT、长上下文成本、prefix/prompt caching、chunked prefill、批处理和推理服务容量规划。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 厚厚旧案:输入 prompt 和上下文
  • 开口前读卷:Prefill 阶段
  • 吐出一个字:Decode 阶段
  • 前半段误讲:未处理完整上下文就生成的风险
  • 分两段记账:区分 prefill latency 与 decode latency
  • 常用旧案先铺好:prefix/prompt caching
  • 长上下文慢:prefill 计算随输入长度增长
  • 第一句话之前:TTFT 的重要组成部分

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

decodeKV cache

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。