← 返回概念解读

Concept Fable精修版

宪法式 AI

Constitutional AI · Alignment

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

学徒先照章自查,再交给师傅复核

城里的公文铺每天要回复大量来信。老掌柜不可能逐封盯着,但新学徒又常把该拒绝的请求写得太热情。掌柜先安排师傅逐条批改。效果很好,可来信一多,师傅排不过来,连低风险小错也占用人工。他又在墙上贴安全口号。学徒读得很熟,真正写信时却不知道哪条原则该压过哪条:要帮人,也要守密;要礼貌,也不能替人伪造凭据。

后来掌柜写了一本小宪章。里面不列具体答案,只列原则:不得泄露私信,不得伪造凭据,不得越权承诺,要说明不确定,能提供安全替代就不要只冷冰冰拒绝。

学徒写完第一稿后,先按宪章自查:哪里帮过头,哪里拒得太粗,哪里缺少理由,哪里需要请师傅看。第二稿再按自查意见改。

起初有人机械套章,把所有敏感来信都挡回去。掌柜拿出几封样信讲解:宪章不是逃避差事的挡箭牌,它要把帮助约束在原则内。

几轮之后,师傅只抽查难信,并把新的冲突案例补进宪章讲义。公文铺能处理更多来信,口径也更稳。

第一版小宪章也不完美。学徒照章拒绝了许多本可安全帮助的来信,客人觉得公文铺变冷了。掌柜又补上几条例子:不能代人造假,但可以说明正规补证路径;不能泄露私信,但可以教人如何自己查公开告示。

学徒们每晚围着小宪章互相审信。有人指出同伴太武断,有人补上更安全的替代说法。师傅只抽看最难的几封。公文铺没有取消人工,只是先让学徒学会按原则自查,把师傅留给真正纠结的地方。 后来掌柜发现,宪章越清楚,师傅越能少改重复小错,多处理真正两难的信。铺子回信速度没有失控,边界也没有靠每个师傅临场记忆硬撑。

老掌柜说,最好的规矩不会替每封信写答案,却会让写信的人学会用原则审看自己的答案。

揭示

这个故事讲的是:宪法式 AI

Constitutional AI 是一种对齐方法,用一组明确原则或“宪章”指导模型生成、 critique 和修订输出,减少对逐条人工偏好标注的依赖。它常用于让模型学习安全、诚实、无害和有帮助的行为边界。企业场景中,宪章可以来自安全政策、合规要求、品牌原则和操作边界,但必须通过评测确认模型没有过度拒绝、机械套话或误解原则优先级。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 公文铺:企业 AI 助手系统
  • 师傅逐条批改:大量人工偏好标注
  • 小宪章:constitutional principles
  • 自查和改稿:AI critique and revision
  • 抽查难样本:人类监督和评测
  • 机械拒绝:过度安全化风险
  • 最后洞察:Constitutional AI 用原则驱动模型自我修订,把对齐从逐条答案扩展到可复用规则

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

alignmentharmlessnesscritiqueRLHFsafety policy