← 返回概念解读

Concept Fable精修版

上下文剪枝

Context Pruning / Prompt Compression · Inference

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

档案馆学会在开卷前先压短信箱

师爷替县令整理案卷,原卷一抱上堂,县令半天翻不到要点。师爷起初靠厚厚的前情材料办事,熟人熟路,日子小的时候很少出错。师爷发现,案卷装得下不代表判断做得好;真正有用的是能改变当前决策的事实、约束、出处和未决问题。

后来案子越审越久,旧证词、重复闲话和无关家事挤在一起。材料越堆越长,重复叙述会挤掉关键证据并增加 prefill 成本;盲目截断又可能删除决定性日期和条件。

第一次修补很急:他先把卷宗随手剪短,结果把关键日期也剪掉了。按页数硬剪卷宗让输入变短,却把关键日期和约束一起删掉。可新毛病跟着出来,大家只盯最容易被看见的地方,远处的小偏差越积越深。

后来他按当前问题筛选、合并和摘要,只保留影响判断的骨架,并标出来源与压缩理由;必要时仍能回到原卷复核。

后来师爷按线索重整:保留人物、争点、证据出处和未决问题,重复说法只留最清楚的一份。这一步麻烦,起初还拖慢了工期;可几轮之后,返工少了,师傅也不再凭脾气改规矩。案卷变短之后仍保留了判断骨架,县令既读得快,也能追问到原始证据。

从此上下文优化不再是越短越好,而是在 token、延迟、KV cache 与证据完整性之间做可审计的取舍。

县令读得快了,追问时也能回到原卷核对。从那以后,材料太长时,删减不是乱砍,而是留下会影响判断的骨架。

概念落点

这个故事讲的是:上下文剪枝

Context Pruning / Prompt Compression reduces prompt length by removing, summarizing, or compressing less relevant content before inference. It lowers prefill latency, token cost, and KV cache usage, especially for long-context applications. The risk is losing facts or constraints that the model needed, so pruning must be relevance-aware and auditable.

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

故事对应

  • 阅览桌:model context window and KV cache budget
  • 整箱卷宗:long prompt / retrieved context
  • 更大的桌子:using larger context windows without selection
  • 只留最近卷宗:naive truncation
  • 剪出、合并、摘要:context pruning and prompt compression
  • 标明来源与复核:preserving evidence and auditability

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

prompt compressionKV cachelong contextLLMLingua

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。