← 返回概念解读

Concept Fable精修版

Token 成本

Token Cost · Business / operations

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

印坊终于开始数每一张被油墨浸过的纸

城南有家替商户印传单的印坊。早年活少,掌柜只按月买油墨、买纸、付工钱,月底看账本觉得还算清楚。谁来印多少,他大多凭感觉估价。

后来商户开始带来长篇告示、反复改稿和多版小样。一个客人看似只付了一次钱,却让印坊排版十遍、印样二十张、废纸一筐。月底收入不少,油墨和纸却耗得吓人。

掌柜先按客户数量收费。小单客户觉得贵,大单客户反而占便宜。第二次修补是按成品张数收费,仍漏掉改稿和试印消耗。真正成本藏在每一次被油墨浸过的纸上。

老账房要求每个订单记下排版字数、试样张数、正式张数、重印次数和废纸。越长的稿、越频繁的修改、越复杂的版式,消耗就越高,不能只看最后交付了几张。

起初伙计嫌记录麻烦。等账本摊开,大家才发现某些低价客户占用了最多纸墨;有些短单虽然频繁,却几乎不浪费。成本终于能被看见和归因。

印坊后来按真实消耗定价,也给商户设置修改次数和长度边界。掌柜明白,使用成本不是抽象月费,而是每次处理输入和输出都会消耗资源;不计量,就不知道利润漏在哪里。

后来有商户要求把百页册子压成一张告示,反复试了十几版。若只看最终一张,几乎不花钱;若看全过程,纸墨已烧掉一大堆。掌柜因此把试算也纳入报价。

印坊也开始优化消耗。常见模板复用,过长稿件先请客户删减,重复改稿超过次数就另收费。成本被看见后,节约才有方向;否则越受欢迎的服务,越可能悄悄亏钱。后来掌柜给客户看消耗明细,争议反而少了。客户知道长稿、多轮修改和大量输出都会花纸墨,便愿意在需求上做取舍。清楚成本,也是在保护交付关系。印坊因此不再害怕受欢迎,而是知道每种受欢迎要付出多少。后来每次报价,掌柜都会先估纸墨消耗,再谈客户愿意买多少。

揭示

这个故事讲的是:Token 成本

Token Cost 是 LLM 应用按输入、输出和中间推理 token 核算的模型使用成本。对 Soloharness 这类 Agent 服务,它不只是技术账单,而是毛利、套餐、用量限制和自动化策略的基础变量。长上下文、反复重试、多模型路由、工具调用后的再总结都会推高 token 消耗;如果只按客户、席位或项目粗略收费,重度客户可能吞掉毛利。成熟做法是把 token 成本纳入 metering、预算上限、缓存、模型路由和价格设计,让客户价值与供应商成本同步增长。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 油墨和纸:模型输入、输出和推理 token
  • 统一涨价:用粗暴套餐掩盖真实成本差异
  • 最多改两次:只限制表面行为,无法控制复杂请求
  • 字数、试印次数和废纸记录:token metering 与成本归因
  • 基础印费和超长文案费:固定费加用量费或超额计费
  • 自动排版与人工校对:缓存、模型路由和人工升级策略
  • 不该接的活:毛利为负的客户或任务边界

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

Input tokensoutput tokenspricingcost per requestcontext windowcaching

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。