← 返回概念解读

Concept Fable精修版

模型监控

Model Monitoring · Model Risk Management

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

桥修好以后也要听水声

柳河镇的新桥通车那天,工匠们很自豪。桥在图纸上算过,石料也验过,第一批车马平安过去,镇长宣布工程成功。

三个月后,河水改道,货车变重,桥面开始出现细纹。守桥人每天扫地,看见裂纹却不知道该不该上报,因为桥已经验收过了。

镇长的修补是每年大检查一次。可问题不会按年历出现。雨季里一周的冲刷,可能比平日半年更危险。

一天夜里,桥头拥堵,重车排队,细纹突然扩成裂缝。工匠赶到时才发现,最近一个月的车重、河速和震动都已经偏离当初设计,只是没人把这些信号合在一起看。

老桥匠提出新的办法:桥通车以后也要继续量。量车重、量震动、量水位、量裂纹、量通行延迟,还要记录每次修补后是否改善。

他们在桥上装了刻尺和铜铃。数值超过阈值会提醒,长期趋势变坏会复查,遇到从未见过的车队类型,会先限制通行再评估。

监控不是为了证明桥永远安全,而是尽早发现它离设计假设越来越远。桥若只在开通前被验证,就会在真实世界里慢慢失真。

后来,镇里换了新桥面材料。守桥人通过同一套指标比较新旧效果,既看短期裂纹,也看长期通行和维修成本。镇长终于明白,那套机器上线像桥通车,验收只是开始;持续看输入、输出、表现和风险,才知道它还适不适合继续承重。后来,又来了一件更棘手的活。表面看只是旧问题放大,实际把藏在流程里的缝隙都逼了出来:谁先接手、谁能改动、出了错怎样回到上一步,过去靠熟人默契混过去的地方,现在都必须说清楚。主事人没有再催大家更用心,而是把现场重新走了一遍。他让人记录每次交接、每次失败和每次补救,哪些地方只是慢,哪些地方会误伤结果,哪些地方一旦错了就很难追回。

揭示

这个故事讲的是:模型监控

模型监控是在模型部署后持续测量其行为、性能、输入、输出、风险和事故。它覆盖数据漂移、概念漂移、质量下降、延迟、成本、异常输出、安全事件和业务指标。对 LLM/Agent 应用,监控还应包括 hallucination、拒答率、工具失败率、人工接管率、token 成本和供应商可用性。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 新桥通车:模型或 Agent 上线
  • 图纸验算和验收:离线评测、验证和发布审批
  • 河水改道、货车变重:输入分布、业务环境和用户行为变化
  • 每年大检查:低频、滞后的检查机制
  • 刻尺和铜铃:metrics、logs、traces、alerts 和 dashboards
  • 限制通行再评估:自动降级、人工接管或重新验证
  • 比较新旧桥面:版本对比和生产效果评估
  • 最后洞察:模型监控确认上线后的模型是否仍然适合当前世界

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

observabilitymodel driftincident managementproduction monitoring

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。