← 返回概念解读

Concept Fable精修版

提示缓存

Prompt Caching · Inference optimization

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

报馆把常用版面先排好,新闻才赶得上清晨

城里报馆每天清晨出刊。每一版都有固定栏目、署名规则、禁用词和广告位置,编辑们却每晚都从空白铅版开始排。

新闻变多后,记者已经把稿子送到,印刷间仍卡在固定版式上。读者抱怨报纸来晚,馆长以为是记者写得慢。

他先催记者提前交稿,又让排版工加班。结果新闻正文确实早到了,铅字仍在重复摆同一套栏头、页脚和声明。

有人把常用话术贴在墙上,可每次排版仍要重新确认:这是不是同一份版规,广告有没有换,某条声明是否仍有效。墙上的提示帮了人,却没有帮排版台。

一位副刊编辑把报馆拆成两层:稳定不变的版规和每晚变化的新闻。稳定部分先排成底版,变化部分再嵌进去;底版一旦改版,就标上新号。

她还规定,不同客户的广告版不能共用,法律声明换过就必须废弃旧底版。相似不等于相同,快不能盖过边界。第一次有人误用旧底版,她宁愿重排,也不让错版进印刷机。

报馆的清晨速度很快变了。编辑不再把时间花在重复确认固定要求,而是集中检查新闻事实、标题风险和读者最关心的段落。

馆长才发现,许多延迟不是来自新内容,而是来自反复处理同一批指令和背景材料。把稳定部分提前留好,才让后面的工作有了余量;但留好的东西也必须知道何时失效。后来每开一个新专题,副刊编辑都先问三件事:哪些版规稳定,哪些内容每天变,哪些变化会让旧底版作废。报馆因此少了许多重复劳动,也少了因贪快造成的错版。速度来自复用,可靠来自失效规则。印刷间后来少了许多深夜争吵。大家知道哪些铅版能直接接着用,哪些必须重排;快慢不再靠熬夜,而靠稳定部分被提前处理。后来复盘时,众人把这条经验写进日常规矩:先看现场哪里真正改变了结果,再决定该保留什么、修补什么、限制什么。

揭示

这个故事讲的是:提示缓存

Prompt Caching reuses previously processed prompt content or prompt prefixes so repeated instructions, policies, examples, and reference material do not have to be fully processed on every request. For enterprise LLM applications, it can lower latency and cost when requests share stable prompts, documents, or workflow scaffolding. It differs from response caching: the model still generates a fresh answer for the variable part, but avoids recomputing reusable context.

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 报馆固定版规:system prompt、workflow instructions、few-shot examples 和共享资料
  • 每晚从空白版开始:每次请求都重新处理完整 prompt
  • 底版:prompt cache 或 prefix cache 中可复用的上下文
  • 改版号:prompt version 和 cache invalidation
  • 客户广告不能共用:tenant isolation 和权限隔离
  • 清晨速度:更低 TTFT、更低 prefill cost
  • 最后洞察:Prompt Caching 缓存的是稳定上下文的处理结果,不是把所有回答固定死

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

KV cacheprefix cachinginference costcontext windowsystem promptlatency optimization