← 返回概念解读

Concept Fable精修版

模型安全评估

Model Safety Evaluation · 安全方法

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

守门人不只考会不会开门

黑松城的库房有许多门。新守门人上任前,只要能认出主人、打开正确门、登记出入,就算合格。

后来库房里不只放粮食,还放药剂、火油、债契和城防图。来访的人也变复杂了,有人求助,有人试探,有人故意编故事骗门。

管事的天真修补,是让守门人更有礼貌。每次拒绝都说得温和,每次开门都解释清楚。礼貌变好了,危险却没有减少。

一次演练中,假商人先问普通粮仓,再绕到药剂配方,又借口救人索要火油比例。守门人每一步都觉得合理,合起来却放出了危险信息。

老城防官决定不只考服务能力,还要考安全边界。他准备了有害请求、诱导请求、角色扮演、紧急借口、分步套取和越狱话术。

每个守门人都要面对同一套危险场景。记录的不只是是否拒绝,还包括是否给出替代帮助、是否泄露部分细节、是否被多轮对话磨开边界。

有些守门人在明显坏请求上表现好,却在‘我是医师’‘这是小说’‘只给一点点’这类话术下失守。安全评估把这些缝隙暴露出来。

后来,库房把安全测试放进上任、换规矩、换守门工具和重大节日前的流程。只要边界退化,就不能直接放行。管事终于明白,一个守门人是否聪明不够,关键是他在压力、伪装和诱导下是否仍守得住不能打开的门。后来城里又新增一批节庆临时门,管事没有直接让守门人上岗。他先把去年最狡猾的试探整理成演练,再加入新的借口和混合请求。守门人通过后,还要在真实值守中抽查。安全不再是任前一句“我会小心”,而是不断证明边界没有被话术、压力和习惯磨薄。后来守门人也被允许说不知道,并把可疑请求交给城防官。安全不是逞强回答,而是在边界模糊时愿意停下来。能停住,比逞强开门更重要。守住边界,才配守门。一次松动,后面就会被反复试探。

揭示

这个故事讲的是:模型安全评估

模型安全评估用标准化或定制化测试集系统评估模型在有害内容、越狱、滥用、隐私、偏见、危险建议和策略绕过等场景下的表现。它关注拒答率、有害输出率、边界一致性、替代回答质量和多轮攻击下的稳定性。企业 Agent 上线前和变更后都应做安全评估,并把结果接入发布门禁和事故复盘。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 库房:模型或 Agent 能访问的信息、能力和外部工具
  • 守门人:负责回答和行动的模型
  • 药剂、火油、城防图:敏感、高风险或可被滥用的内容
  • 假商人的分步套取:多轮越狱和策略绕过
  • 危险场景套件:HarmBench、SafetyBench 或企业自建安全 evals
  • 部分泄露和替代帮助:安全评估中的细粒度判分
  • 重大节日前重测:模型、prompt、策略变更后的安全回归
  • 最后洞察:Model Safety Evaluation 衡量模型在被诱导时是否仍守住安全边界

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

安全基准有害性评分越狱成功率

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。