← 返回概念解读

Concept Fable精修版

模型服务

Model Serving · Inference

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

名厨的菜谱挂上墙以后,还要有能开张的饭铺

城里有位名厨写出一本好菜谱。商人买到菜谱后很兴奋,以为只要挂在墙上,客人就会吃到好菜。第一天开张,问题接连出现:炉子不够,点单混乱,食材断货,有人要快餐,有人要宴席,还有贵客要求单独隔间。商人先责怪菜谱不够神奇,又让厨师临场补救。厨师能做菜,却不能一个人负责排队、备料、上菜、结账和投诉。有人建议每来一个客人就新搭一口锅。这样简单,却贵得吓人;客人一多,院子里全是锅,火力也不稳定。

饭铺经理重新设计了开张系统:前台接单,后厨调度锅位,仓库监控库存,账房记录成本,门口限流,贵客单独隔离,出错有备用菜。

他还按不同目标配置服务:有的窗口追求首口快,有的追求大批量,有的允许慢一点但必须便宜,有的必须保留审计记录。

菜谱没有变,但饭铺终于能稳定营业。客人感受到的是一整套服务,而不是墙上的那本菜谱。

商人明白,菜谱本事只是原料。要让客人每天吃到饭,还需要窗口、排队、备菜、限客、验牌、备用菜、账房和成本控制。

经理还给饭铺设了账牌:每桌等多久、哪口锅空着、哪道菜容易堵住、哪类客人该转到小灶。菜谱仍是核心,可没有这些开张规矩,名厨的本事到不了客人嘴边。

饭铺经理还学会了给不同客人安排不同座位。只喝汤的坐快桌,宴席进里间,外卖走侧门;若所有人都挤在名厨面前,哪怕菜谱再好,也会变成一场堵门的热闹。 后来饭铺遇到节庆客流,经理提前扩锅、备料、分桌。客人只记得上菜稳,却看不见背后的排队和调度。真正开张,靠的是整套可运行的饭铺。

后来他们评估新菜谱时,会同时问:能不能服务、怎么服务、服务到什么质量。不能开张的菜谱,只是资产,不是业务。

揭示

这个故事讲的是:模型服务

模型服务是把模型放到生产环境里,通过 API 稳定处理推理请求的运行层。它不只是“模型能跑”,还包括端点、批处理、调度、自动扩缩容、GPU 分配、缓存、流式输出、鉴权、监控、限流、回退和 SLA 管理。

对企业 Agent 产品来说,模型服务架构会直接决定延迟、吞吐、成本、租户隔离和运行可靠性。模型能力再强,服务层不稳也无法交付。

隐喻映射

  • 菜谱:model weights and capabilities
  • 饭铺:production serving infrastructure
  • 前台接单:API endpoint and request routing
  • 后厨调度锅位:scheduler, batching, GPU allocation
  • 仓库和账房:resource monitoring and cost tracking
  • 贵客隔间:tenant isolation and priority classes
  • 备用菜:fallback and graceful degradation
  • 最后洞察:Model Serving 把模型变成可被业务稳定调用的服务,决定交付质量和成本结构

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

inferencelatencythroughputGPUendpoint

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。