← 返回概念解读

Concept Fable精修版

测试时计算

Test-Time Compute / Inference-Time Scaling · Inference

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

顾问馆把难题的灯油单独加满

城中顾问馆每天回答商户的问题。旧规矩很公平:每个问题给同样一盏灯、同样一张纸、同样一刻钟。简单账目能答,复杂纠纷也只能到点停笔。

馆主先训练顾问们写得更快。短问答更顺了,但遇到跨城契约、税务和运输风险,快笔只会更快地写出不完整答案。

有人建议所有问题都给三倍灯油。账房马上反对:大部分问题不需要,灯油会被简单问题白白烧掉,真正难题依旧缺少判断路线。

后来馆主把问题分级。简单问题照常回答;中等问题先列几条思路再合并;困难问题允许多轮推演、请验算师评分,甚至让几位顾问分别作答后择优。

这套新法让馆里看起来不再绝对公平,因为每个问题消耗的灯油不同。但交付结果更公平:难题得到足够思考,简单题不被过度加工。

馆主也设了边界。灯油不是无限加,超过预算仍要停止;需要法律责任的案子,不能只靠多想,还要找能签字的人复核。

一段时间后,顾问馆不再把能力只理解为顾问本人的聪明。临场分配多少思考、搜索、候选和验证,也成了能力的一部分。

馆主最后写下规矩:训练决定顾问会什么,交付时的计算决定他在这一题上愿意多认真。两者都要算进系统设计。后来账房也接受了这套账:不是每题都烧同样灯油,而是把灯油投到最能改变答案质量的地方。难题多花的成本,必须换来更可靠的判断。顾问们也学会向商户说明:多花灯油不是装样子,而是因为这道题的错误代价更高,需要更多候选、校验和取舍。馆主每晚还会核账,确认多烧的灯油确实买到了更少的误判。馆主每晚还会核账,确认多烧的灯油确实买到了更少的误判,而不是只换来更厚的纸。

揭示

这个故事讲的是:测试时计算

测试时计算,也更直白地说是推理时扩展计算,是在模型运行时额外花计算来提升输出质量。这里的“测试时”不是软件测试阶段,而是模型面对新输入生成答案的阶段。

常见做法包括更长推理、多候选、自一致性、验证器引导搜索或树搜索。它可能提升难题表现,但会增加延迟和成本,所以要按任务价值决定什么时候值得用。

隐喻映射

  • 灯油:inference-time compute budget
  • 多轮推演:longer reasoning or deliberation
  • 几位顾问分别作答:sampling multiple candidates
  • 验算师评分:verifier or reward model
  • 问题分级:routing extra compute by difficulty and value
  • 预算边界:latency, cost, and operational constraints

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

chain-of-thoughtbest-of-Nreasoningscaling