← 返回概念解读

Concept Fable精修版

安全微调

Safety Fine-Tuning · 对齐技术

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

夜航船的危险货单

港口船行有一批年轻押运员,脚程快,记性好,问什么都肯答。早年货少,掌柜夸他们利落;后来有人托运火药、私盐和来历不明的药粉,麻烦开始出现。

掌柜第一招是在门口贴禁运清单。几天内确实少了几票危险货,可押运员遇到拐弯问法就糊涂:有人把火药说成‘节庆红粉’,有人让他们教如何避开巡检,他们仍热心指路。

又有人主张凡是可疑都拒绝。结果盐商的合法凭证被挡,医馆急需药材也被耽误。押运员不是更安全了,而是又莽又胆小。

老船长把他们拉到码头反复演练。哪些请求要拒,哪些要追问凭证,哪些可以给安全替代路,哪些必须请掌柜裁断;每次答错,都让他们看后果:船被扣、病人断药、伙计受伤。

掌柜又派人在旁边盯着,每听到危险字眼就咳嗽提醒。押运员一开始会停,后来遇到温和说法又放行;遇到正当的药材说明又被吓得不敢答。只靠门口清单和旁人提醒,他们没有学会在真实对话里分辨边界。

船行于是安排专门演练。老师傅扮成各种客人,有人认真咨询运输规范,有人试探禁货漏洞,有人一步步诱导押运员说出危险路线。每次答完,老师傅当场纠正:哪些要拒,哪些可安全说明,哪些必须请掌柜处理。练久了,押运员的反应才变成自己的手艺。

后来押运员遇到新说法,也会先想这趟货可能造成什么伤害、对方是否在套取禁路、能否给出安全替代说明。禁单仍在门口,但真正起作用的是他们在演练中长出的判断。

几个月后,押运员仍能帮人办事,却学会在危险处放慢手。真正的规矩不只贴在门口,而要长进他们的判断里:能帮忙,也要知道什么时候不能照办。

揭示

这个故事讲的是:安全微调

Safety Fine-Tuning 是在预训练、指令微调或偏好优化之后,用安全数据继续训练模型,让它更稳定地拒绝危险请求、减少有害内容输出,并在企业策略边界内行动。它需要覆盖真实攻击、灰区请求和业务例外,否则容易只会背安全口号。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 港口船行:企业中的 AI / Agent 系统或模型训练体系
  • 货单:样本、token、任务请求、模态信息或模型内部表示
  • 在门口贴一张禁运清单:只改表层规则的天真修补
  • 不断增加的表格和口号:没有改变目标函数、数据质量或系统结构的管理动作
  • 追踪输入、判断、动作和反馈:训练与评测所需的数据闭环
  • 用大量安全场景训练押运员识别危险请求、拒绝越权操作并给出安全替代方案:围绕 Safety Fine-Tuning 建立的结构性解法
  • 最后洞察:模型能力要落到企业交付,必须同时处理数据、目标、训练过程、架构和治理

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

安全对齐拒绝训练有害性抑制