← 返回概念解读

Concept Fable精修版

吞吐量

Throughput · Inference

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

粮仓终于算清一小时能出多少袋米

救灾粮仓开仓发米。仓官最初只盯最快的秤手:他一炷香能称二十袋,大家便夸粮仓效率高。可门外队伍仍越排越长。

新总管站在旁边看了一天,发现秤手再快也常空等。取米的人没把袋子送到,账房还没记村名,封袋处缺绳,装车口又被大车堵住。最快的一瞬间,救不了整条队伍。仓官还拿最快秤手做榜样,让其他人照学。结果大家都学会快称,米袋却更快堵在封袋口,队伍里的老人等得更久。

仓官先加派秤手,结果称好的米袋堆在地上,账册跟不上。又加账房,装车口堵得更厉害。每一段单独变快,都可能把瓶颈推给下一段。

总管把流程拆成取米、称重、封袋、记账、装车五段,逐段看一刻钟能稳定完成多少袋,也看谁在等谁。他把相同村单合并,短单穿插在长单间,装车口按路线分队,账房提前写好村牌。总管第一次只调瓶颈,没有管入口节奏。取米处一下放进太多人,称重虽快,账房桌前又乱成一团。

一天结束,发出的米明显增加,队伍也更顺。但总管提醒:只追求发袋数量,可能让远村一直排后。产能要和等待、优先级一起看。他后来加了几条保护规则:救急村先走,远路车队提前装,久等队伍插入短单。发得多,也要发得不失序。

救灾结束后,总管把一天分成几段复盘。早晨卡在取袋,中午卡在账房,傍晚卡在装车。瓶颈会移动,吞吐也要持续看,不能只修昨天最堵的地方。

仓官终于明白,吞吐不是某个人最快一次的表演,而是整套流程在单位时间内稳定交付多少。要提高它,就要看瓶颈、空等和节奏,而不是只给最快环节鼓掌。

揭示

这个故事讲的是:吞吐量

Throughput is the amount of work a model serving system can process over time, often measured as requests per second or tokens per second. It depends on batching, GPU utilization, KV cache memory, model size, sequence length, scheduling, and downstream tools. High throughput lowers unit cost and supports scale, but must be balanced against latency, fairness, and service-level targets.

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 粮仓:model serving system
  • 每小时出米袋数:requests/sec or tokens/sec
  • 秤手最快一次:single-request speed, not system throughput
  • 取米到装车:pipeline stages in serving and Agent workflow
  • 合并村单:batching and scheduling
  • 某些村等太久:throughput-latency tradeoff and fairness
  • 最后洞察:Throughput 决定系统规模和单位成本,但不能脱离 latency 与 SLA 单独优化

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

latencybatchingGPU utilizationservingtokens per second

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。