← 返回概念解读

Concept Fable精修版

每秒 token 数

Tokens Per Second, TPS · Serving metric

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

抄经院开始数每息落下多少字

寺里的抄经院过去只问一卷经多久抄完。院主看总时间,施主看交付日,没人关心笔尖在纸上每一息能走多远。

后来订单变复杂,有的经卷开头要查许多注脚,真正落笔后却很快;有的开头简单,后面每句都慢。只看总时间,谁也不知道慢在哪里。客人开始抱怨:有的抄手迟迟不开笔,开笔后飞快;有的马上落字,却越写越慢。两种等待感完全不同。

院主先催抄手别停笔。抄手委屈地说,有时他们并没有停,是前面找纸、磨墨、排版占了时间。

于是账房开始分开记录:第一字什么时候出现,之后每息平均落下多少字,哪些时段多人共用一张大桌。账房第一次只记平均落字,结果把开头准备时间也算进去,速度看起来忽快忽慢。抄手据理争辩,诊断才被拆成几段。

他们发现,每息落字数能衡量持续书写速度,却不能单独说明全部体验。第一字太晚,客人仍会焦急;字速很高,总卷太长也会久等。

院主也不再拿不同经文硬比。有的字大,有的小注多;比较速度时,必须说明纸张、笔法、并发人数和经卷长度。一次他们换了新笔,落字数涨了,错字也多了。院主这才把速度和改错成本并排看,免得只追一张漂亮速度牌。

有了这个指标,抄经院能判断换笔、换桌、换排队法到底有没有让生成阶段变快,而不是只听谁喊更顺。院主还用这个指标安排承诺。急件要看第一字等待,长卷要看持续落字,众人同桌要看拥堵。只报一个速度,容易让施主误解真正的交付时间。

账房最后写下:每息落字数不是荣誉牌,是诊断表。它告诉抄经院持续落笔的速度,但要和第一字等待、总卷长度、同桌人数和成本一起看。

揭示

这个故事讲的是:每秒 token 数

每秒 token 数(TPS)衡量模型或服务系统每秒生成多少 token,通常主要看解码阶段。它是速度和吞吐的重要指标。

但 TPS 不能单独解读。首 token 时间、总延迟、提示词长度、batch 大小、硬件、并发和输出长度,都会影响用户真实感受到的速度。

隐喻映射

  • 每息落下多少字:tokens per second
  • 第一字什么时候出现:time to first token
  • 找纸磨墨排版:prefill and request setup
  • 持续书写:decode phase generation
  • 多人共用大桌:batching and concurrency
  • 纸张、笔法、并发人数:benchmark conditions that affect TPS

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

throughputlatency

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。