← 返回概念解读

Concept Fable精修版

缓存

Caching · LLM infrastructure optimization

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

茶馆不再每次都重新烧同一壶水

山路茶馆每天接待赶路人。许多人问同样的话:去东渡口几里,哪里能换马,雨天哪条路会塌。伙计每问一次都跑去后院翻路册,炉火烧着,客人排队。

掌柜先让伙计答得快些。快是快了,却有人把昨日晴天的路况拿来回答今日暴雨,结果两辆货车陷在泥里。省事若不看新旧,会把错答也省下来。

后来掌柜在柜台放小木匣,把最常问、短期不变的答案写成牌:东渡口里程、马厩位置、城门时辰。每张牌背后标明何时写、何时重查。遇到雨、塌方、官道封锁,牌子立刻翻面作废。

伙计还学会分辨:问‘东渡口几里’可直接取牌;问‘今日带瓷器走哪条最稳’必须翻册、问脚夫,不能偷懒。重复且等价的问题,才配从匣中取答案。

茶馆先在墙上贴常见问答。晴天时很好,雨后一塌糊涂;早晨渡口开着,午后水涨就停。伙计若只背墙上的旧答,越熟练越危险。

老掌柜改成两层牌:稳定的事写在木牌上,路况、船期、马价这些会变的事写在可擦的湿牌上,并标明最后查看的时辰。客人再问同样问题,伙计先看是否还新鲜;新鲜就快答,过时就回后院重查。省时的前提,是知道答案什么时候会坏。

跑堂们也知道了哪些答复绝不能偷懒。问路可以看旧牌,问塌方必须查新报;问茶价可直接答,问药铺是否开门要再确认。快答和准答之间,要有新旧判断。跑堂们也知道了哪些答复绝不能偷懒。问路可以看旧牌,问塌方必须查新报;问茶价可直接答,问药铺是否开门要再确认。快答和准答之间,要有新旧判断。

茶馆很快安静下来,柴火和人力留给真正需要判断的事。记住可复用的答复,不是懒,而是把重复成本拿掉;边界不清,旧答案就会变成新麻烦。

揭示

这个故事讲的是:缓存

缓存是在 LLM 应用中复用已有响应、embedding、检索结果、工具结果或 prompt prefix,以降低延迟、成本和重复模型调用。缓存设计要关注命中率、失效策略、语义等价判断、权限隔离、数据新鲜度和错误缓存风险。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 茶馆:LLM / Agent 应用服务
  • 每次重新烧水:每个请求都完整调用模型、检索和工具
  • 墙上常见答案:粗糙静态缓存
  • 几个小柜:response cache、retrieval cache、embedding cache、prefix cache 等缓存层
  • 期限和适用条件:TTL、invalidation、scope 和 cache policy
  • 意思相近问题:semantic caching
  • 节省的柴火:token cost 和 latency savings
  • 最后洞察:缓存通过受控复用降低成本和延迟,但必须避免复用过期、越权或错误结果

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

semantic cacheprompt cacheresponse cacheembeddings cachegatewaycost optimization