← 返回概念解读

Concept Fable精修版

推理

Inference · Inference

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

训练好的司炉工第一次面对陌生订单

铁器铺有位司炉工,学了三年火候、铁色和锤法。师傅带他看过上千把刀、锄和铰链,他终于能背出每种材料该怎么处理。

学成那天,城外来了一个陌生订单:一把给盐雾海船用的细长钩刀。书上没有同样的图,师傅也不替他动手,只让他按所学现场做。

司炉工先把所有学过的样式都翻出来,想找一张完全相同的图。找不到时,他差点要求重新上三年课,好像只有再训练才有资格开炉。

师傅提醒他:训练已经结束,眼前要做的是把学到的规律用于新输入。你不会改写过去的教材,只会在当前火炉里给出一个结果。

司炉工开始观察盐雾、船绳、握柄和受力方向,决定火温、锤击顺序和冷却时间。每一步都消耗炭火,也有等待;做得慢,客人焦急;做得粗,刀会断。

有些订单可以几件一起加热,有些必须单独处理。师傅让他记录从接单到第一锤的时间、总耗炭量和最后成品是否合格。

几个月后,铺子发现真正的瓶颈不是会不会打铁,而是新订单来了以后,怎样在成本、速度和质量之间稳定产出。

司炉工终于懂了:学会一门手艺是一回事,把手艺用在每个新请求上并交出结果,是另一回事。后者才是铺子每天对外承诺的现场能力。后来司炉工带徒弟时,也遇到同样误会。徒弟以为只要背熟旧图,就能面对所有订单;另一人则以为遇到陌生件就必须回炉重学。司炉工让他们各打一把变形钩刀,记录从看图、选料、加热到交付的全过程。大家才看清,现场产出依赖已学规律,也受当前炭火、等待队列和质量要求约束。后来铺子把不同订单的耗炭和返工也记下来。司炉工不再只追求一次做对,还要知道每次现场出活付出了多少代价。每张新单,都是一次真正的现场使用。铺子的承诺,就落在这一步。每次交付都在消耗真实资源。

揭示

这个故事讲的是:推理

这里的 inference 指模型推理或模型运行:把训练好的模型用于新的输入,并生成输出。它不是人类意义上的逻辑推理,而是模型在当前请求上执行计算。

在 LLM 系统里,推理包括提示词处理、预填充、解码、采样、批处理、服务延迟和成本控制。通常它不会更新模型权重,只使用已经训练好的模型给出当前回答。

隐喻映射

  • 三年学艺:模型训练
  • 陌生订单:新的输入或提示词
  • 现场开炉:运行推理
  • 不会改写教材:普通推理不会更新模型权重
  • 从接单到第一锤:首个 token 等待时间 / 预填充延迟
  • 总耗炭量:计算成本和 token 成本

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

servinglatencydecodingbatch sizeprompt

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。