← 返回概念解读

Concept Fable精修版

持久执行

Durable Execution · Platform / reliability

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

熄灯之后还会继续走的驿站马车

北境有一条很长的邮路,从雪岭到海港要经过九个驿站。每辆马车都带着账册、信件、药材和官文。老规矩是:车夫记住路线,天亮就走,天黑就停,第二天继续。

这套办法在短途上没问题。可长途常遇到雪崩、断桥、马病和驿站失火。一次车夫在第三站病倒,新车夫只知道目的地,却不知道哪些信已交、哪些药材已换冰、哪些官文需要回执。

总驿长先要求车夫更细心,把路线背熟。第二次出事时,马车翻在河滩,背得再熟也随人一起中断。后来他又让每站派人询问进度,消息多了,仍无法恢复已完成和未完成的边界。

老账房提出分段留痕。每过一站,车夫要在站册写下已交物、剩余物、下一站、可重做事项和绝不能重复的事项。车坏了,新车可按站册继续;药材损坏,也能从最后确认点补救。

第一次按新法重跑,大家发现有些动作可以重复,比如重新通知下一站;有些动作不能重复,比如已交的银票不能再发一次。站册不仅记录进度,也区分重试、补偿和确认。

后来北境邮路仍会遇到风雪,却不再因一次熄灯就从头乱来。总驿长明白,长任务的可靠性不靠车夫永不出错,而靠过程能保存、恢复、重试,并在中断后继续走完。

有一次海港回信丢失,站册显示银票已交、药材未交、官文待签。新车夫没有凭感觉重发全部物品,而是只补药材并请求官文回执。损失被控制在一段,而非整条路。

总驿长后来把这套办法教给所有长途差事。凡是跨多天、多站、多人的任务,都必须能说清当前进度、上次确认点和失败后的恢复方式。否则路再熟,也只是把成败押在一次不中断上。新车夫入行时,师傅让他故意在第五站中断一次,再按站册恢复。只有能从中断处接着走的人,才被允许承担真正的长途邮路。邮路靠这种痕迹抵抗风雪和人手变化。

揭示

这个故事讲的是:持久执行

持久执行是让长任务在进程崩溃、机器重启、网络中断、超时或人员切换后仍能继续或恢复的执行方式。它通过持久化事件、状态、输入输出和检查点,避免任务只存在于内存或一次会话里。对 Agent 来说,持久执行意味着复杂任务不会因为模型调用失败、工具超时或运行环境重启而丢失上下文和进度。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 北境邮路:长时间、多步骤、跨系统的 Agent 任务
  • 车夫:当前执行进程、会话或 Worker
  • 车夫发烧、断轴、暴雪:进程崩溃、网络中断、工具失败、外部环境异常
  • 湿掉的账册:只存在局部或内存里的脆弱状态
  • 中央石册:持久化事件日志、状态存储和检查点
  • 不可重复动作:需要幂等控制的外部操作,例如付款、发信、写数据库
  • 从最后可靠记录点恢复:断点续跑、重试和恢复机制
  • 灯可以熄但任务继续:持久执行把任务生命从单个进程中解耦出来

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

Workflow enginestate persistenceretriesidempotencyTemporalorchestration

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。