← 返回概念解读

Concept Fable精修版

服务级别目标

Service Level Objective, SLO · Reliability / operations

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

酒楼真正等的是哪一刻

热汤面铺在集市口很有名。老板最爱看厨房忙不忙,灶火整日不灭,师傅手也不停。他觉得只要厨房满负荷,铺子就算好。

可客人抱怨越来越多。有时厨房很忙,面却凉着送到桌;有时师傅做了许多花样小菜,赶路客人只想十息内拿到热汤面。老板盯着后厨辛苦,却没盯住客人真正感受到的结果。

账房建议写下承诺:午市普通汤面,百碗里至少九十五碗要在半盏茶内上桌,且汤到桌仍冒热气;雨天和庙会另算容量。这个目标不写灶火烧多久,而写客人在什么条件下得到什么服务。

面铺开始按目标排班。若等待过长,就暂停低价值花样;若热度不够,就调整送餐路线;若大单会挤掉散客,老板先问是否会破坏热汤承诺。

第一次修补只设了平均时间,结果一半客人很快拿到面,另一半等到汤凉,平均数仍好看。账房改看大多数客人的实际等待和热度,还把庙会、雨天、普通午市分开看。

有次厨房整天很忙,目标却没达成。老板终于没有夸勤快,而是查哪一段让客人等冷:煮面、装碗、记账还是送桌。忙碌不再等于可靠,内部辛苦也不能替代外部体验。

后来面铺墙上不只挂“我们很努力”,而挂清楚的服务目标。它让扩张、排班和取舍都有了尺子:客户在关键条件下能稳定拿到什么,比内部机器转了多久更重要。

后来老板开第二家店,没有先问灶台要多大,而是先写客人等什么、等多久算稳、哪些时段要另算。灶台、跑堂和菜单都围着这把尺安排。面铺扩张后仍有味道,靠的不是忙,而是目标清楚。后来客人未必知道这把尺,却能稳定吃到热面。

揭示

这个故事讲的是:服务级别目标

A Service Level Objective, or SLO, is a specific measurable reliability target for a service, such as 99.9% successful task completion under a latency threshold over a time window. In AI Agent systems, SLOs should reflect user-visible outcomes: task success, response latency, tool reliability, escalation time, unsafe output rate, or workflow completion quality. A good SLO defines the indicator, threshold, measurement window, included traffic, excluded cases, and operational response when the target is at risk.

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 送餐木偶:AI Agent 服务
  • 跑腿次数:内部活动指标
  • 热汤二十分钟送到正确桌上:面向用户结果的 SLO
  • 平均时间掩盖尾巴:只看均值的可靠性误判
  • 红线响应:当 SLO 风险升高时改变发布和运营节奏
  • 节庆另列口径:清楚定义测量窗口和例外条件
  • 最后洞察:SLO 把可靠性定义成客户能感知、团队能操作的承诺

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

SLASLIerror budgetavailabilityreliabilityincident management

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。