← 返回概念解读

Concept Fable精修版

Chunked Prefill

Chunked Prefill · Serving optimization

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

长卷入馆时不再一次铺满整张桌

档案馆接到一卷极长的海贸契约。旧规矩要求先把整卷铺开、编号、读完,之后才允许任何人处理下一份小申请。这天长卷占住了唯一大桌,后面只问一个地址的小纸条也要等。馆员们没有偷懒,可短事被长事挡在门外,队伍越来越急。馆长先规定长卷只能上午来。下午确实轻松些,上午却变成灾难;而且真实业务不会按馆长的时辰表到达。

有人建议把长卷退回,让客户改短。客户说契约本来就长,不能因为馆里桌子小就删掉关键条款。

后来调度员把长卷预读切成几段。馆员先处理一段,释放桌面,再夹入几张短纸条,然后继续下一段长卷。

长卷并没有被丢弃,最终仍会完整读完。不同的是,预读工作不再一次吞掉全部计算时隙,短请求能在段与段之间进入。

馆里开始记录每段大小、切换成本和短纸条等待时间。分得太碎会来回搬纸,分得太粗又会挡住别人。

馆长终于看到,长输入的麻烦不只是总量大,而是预填充阶段容易独占资源。把预填充切块调度,能让长短请求在同一套服务里共存。

调度员第一次切得太细,馆员光是卷起、放下、重新找位置就耗了半天。第二次切得太粗,短纸条又被挡住。馆长这才把段长当成需要调的手艺,而不是随手一剪。

后来馆里同时来了长契约、短地址和中等账单。大桌像有了呼吸,长卷稳步推进,短事不再饿死在门口。大家终于明白,公平不是让每份纸都一样长,而是让资源不被某一份纸独占。这门手艺让馆员既尊重长卷的完整性,也照顾短纸条的等待成本。馆里的长短活,终于能在同一张桌上轮流前进。

揭示

这个故事讲的是:Chunked Prefill

Chunked Prefill splits the prefill processing of long prompts into smaller chunks so a long request does not monopolize the GPU scheduler. This helps interleave long-context requests with shorter decode work, improving responsiveness and fairness while still eventually processing the full prompt.

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 极长海贸契约:long prompt / long context request
  • 铺开整卷再处理别人:monolithic prefill blocking the scheduler
  • 切成几段预读:chunked prefill
  • 短纸条夹入:short requests interleaved between chunks
  • 段大小和切换成本:scheduling tradeoff
  • 完整读完:chunking changes scheduling, not the semantic input

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

prefillscheduling