← 返回概念解读

Concept Fable精修版

记忆压缩

Memory Compression · Agent memory

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

档案馆把十车旧案压成一册行路簿

江湾档案馆替城里的巡检队保存案卷。早年事情少,巡检每次出门前都把过去相关卷宗全装上车,路上慢慢翻,总能找到一点有用的线索。

后来案子变多,卷宗堆到十车。巡检还没到现场,马已经累坏;书记为了省事,只带最近三本,结果旧案里的关键人名又常被漏掉。

馆长先让抄录员写摘要。每本卷宗都被压成三行,可三行太短,只剩结论,没有证据、时间和例外。巡检按摘要行动,几次把相似案件混成同一类。

另一位书记反过来保留所有细节,只删掉寒暄和废话。车轻了一点,但每次仍要带很多册,真正有用的线索还是埋在纸堆里。

一名老案师开始分层整理。他把长卷压成案件经过、可靠事实、未解问题、人物关系和下次行动提示;无法确定的地方明确标成待查,而不是假装已经懂了。

他还规定,只有反复影响判断的事实进入常用行路簿。一次性的噪声留在原卷里,需要时再回查。

巡检起初担心压缩会丢东西。老案师让他们每次办完案都把压缩簿和原卷对照:哪些摘要帮了忙,哪些遗漏造成误判,哪些旧事实已经过期。

几个月后,巡检出门只带一册行路簿和少量原卷索引。队伍走得更快,也更少把旧案当新案。馆长终于明白,记忆的价值不在于把过去原样搬到今天,而在于把未来决策真正需要的信号留下来。后来行路簿每月重修一次:被证明有用的留下,误导过人的改写,失效的标红。压缩不是把旧事变短,而是让旧事继续服务新判断。巡检也学会不迷信行路簿。遇到关系重大的判断,他们会顺着索引回到原卷,确认压缩没有把关键例外磨平。

揭示

这个故事讲的是:记忆压缩

Memory Compression 将长对话、历史观察、检索材料或执行轨迹压缩成更短的摘要、结构化事实或可检索记忆,使它们能放进后续 context budget,同时尽量保留对任务有用的信号。企业 Agent 需要它来控制 token 成本、减少上下文噪声,并让长期任务在多轮执行中不丢关键状态。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 档案馆:保存 Agent 历史上下文和任务记忆的系统
  • 十车旧案:长对话、日志、检索片段和执行轨迹
  • 三行摘要:过度压缩,丢失可验证细节
  • 分层整理:summary、facts、open questions、entities、next actions 等结构化记忆
  • 常用行路簿:后续 prompt 或 memory store 中保留的高价值信号
  • 回查原卷:必要时返回原始记录或外部知识库补证据
  • 最后洞察:记忆压缩不是单纯变短,而是在有限上下文里保留未来行动所需的信息

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

context windowsummarizationlong-term memorysemantic memorymemory consolidationtoken budget