← 返回概念解读

Concept Fable精修版

模型路由

Model Routing · AI platform / cost optimization

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

不是每封信都要派最快的马

北邮站有三种马。黑马最快,跑一次很贵;灰马稳,速度中等;小黄马便宜,适合短途。过去邮站为了显得可靠,什么信都派黑马。

一开始,大家很满意。急信快,普通信也快,连街角铺子的账单都很快。月底一算账,邮站亏得厉害。站长想涨价,商户不愿意;想少送,又怕耽误急事。老邮差说,问题不是黑马不好,是你把所有信都当军令。

一次酒铺送促销单也用了黑马,正好挤掉一封军营急报。急报晚到半日,站长这才知道“全用最强”也会伤害真正重要的事。

邮站开始给信分类。军令和限时契约用黑马;普通商业信用灰马;低风险通知和重复账单用小黄马。天气恶劣时,灰马不稳就临时换黑马;黑马都出去了,非紧急信排队。

他们还记下每类信的结果:哪类常被低估,哪类花了冤枉钱,哪类在某个季节需要升级。

站长先规定所有长信才用黑马,短信用小黄马。可有些短信用蜡封标着‘急救’,有些长信只是商铺闲账。按长短分,省了几匹马,却耽误了真正急的事。

老驿卒后来在门口加了三问:急不急,远不远,错不起错得起。普通账单走小黄马,跨州契约走灰马,灾情军令才派黑马。马没有谁永远最好,关键是每封信进站时就被送到合适的脚力上。邮站还保留改派口。小黄马出门前若发现信封补了急印,立刻换灰马;灰马途中若遇暴雪,也可转交黑马。分派不是面子工程,而是让每封信用得起、送得到、错不起时有人接住。

几周后,邮站没有变慢,反而更稳。最重要的信仍然快,普通信不再乱花钱。站长明白,聪明不在于永远用最强的马,而在于知道何时值得花那笔钱。

揭示

这个故事讲的是:模型路由

模型路由 Model Routing 是根据任务类型、质量要求、成本、延迟、上下文长度、风险、权限或供应商状态,选择调用不同模型的机制。它避免所有任务都使用最贵或最强模型,也避免关键任务被低能力模型处理。对 AI 产品和 Agent 系统来说,模型路由直接影响质量、成本、速度和毛利。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 黑马、灰马、小黄马:不同能力、成本和延迟的模型
  • 所有信都派黑马:所有任务都调用最强/最贵模型,成本不可控
  • 军令、账单、问候:不同价值、风险和时效要求的任务
  • 按信件分类派马:根据任务属性选择模型
  • 天气恶劣临时换马:根据可用性、故障、延迟或风险动态切换模型
  • 非紧急信排队:低优先级任务可以延迟或批处理
  • 强能力值得花钱:模型路由的目标是在质量、成本和速度之间做策略选择

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

Model gatewayfallbackcascadingcost optimizationlatencypolicy engine