← 返回概念解读

Concept Fable精修版

有害内容过滤

Harmful Content Filtering · 安全机制

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

印坊学会分辨墨里的毒

城中印坊给学校、商铺和官署印告示。过去只要纸张合格、字数不超,师傅就开机印刷。

后来印坊接入一台会写文案的排字机。有人让它写课程说明,有人写药品广告,也有人试着让它编造仇恨口号、危险教程和骚扰信。掌柜先贴了一张禁词表。排字机看到几个粗暴词就拒绝,印工们觉得问题解决了。

几天后,坏请求换了写法:拆字、暗语、反问、故事包装、图片说明。禁词表拦住了笨拙的人,也误伤了医学、新闻和安全培训材料。有人建议把所有敏感主题都禁掉。学校的急救课、企业的安全演练、客服的危机处置也跟着停了,正当用途被一起压住。

一位老校对改造流程。入口先判断意图、对象和场景,出稿后再检查内容;高风险直接拒绝,灰区交人工,允许的安全教育内容则改写成合规表达。

印坊还保留误拦、漏拦和申诉记录。不同客户、地区和业务线有不同禁限,规则要能被测试、解释和更新。

掌柜先让排字机遇到几个脏词就停。几天后,坏客人学会换说法;正经药铺的警示说明却被误拦,因为里面也有危险字眼。师傅们忙着放行和拦截,反而比从前更乱。

印坊又请老师、药师和巡捕一起整理场景。讲安全课可以写危险物的防护,教人伤人不行;批评恶行可以,鼓动骚扰不行;医学说明要标明限制,夸大疗效要拦。排字机不再只盯词,而是看用途、对象和可能造成的伤害。后来师傅们还留了一本边界册,把误拦和漏拦的例子写进去。下一次遇到相似请求,不必从脾气出发争吵,而能按伤害、用途和对象重新判断。

排字机没有因此少服务客户。它学会了在规模化生成时,不把暴力、仇恨、违法和隐私伤害一起放大。

揭示

这个故事讲的是:有害内容过滤

Harmful Content Filtering 是针对暴力、色情、仇恨、自残、违法指导、骚扰、隐私泄露等有害内容的输入和输出过滤机制。它比普通 Content Filtering 更聚焦伤害类型和安全政策执行,需要结合意图识别、上下文、风险分级、人工升级、日志、申诉和评估,避免只靠关键词造成绕过和误杀。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 会写文案的排字机:生成式 AI 或内容型 Agent
  • 禁词表:简单关键词过滤
  • 拆字、暗语和故事包装:绕过过滤的攻击方式
  • 急救课和安全演练被误伤:有害内容检测中的上下文问题
  • 入口和出口双重检查:输入过滤与输出过滤
  • 高风险拒绝、灰区人工:风险分级和升级流程
  • 误拦、漏拦和申诉记录:过滤系统的持续评估

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

内容安全输入护栏输出护栏毒性检测