← 返回概念辨析

Concept Contrast Fable

对抗性评估和红队测试,一个是用工具自动攻,一个是请人手动想歪招

对抗性评估通过自动化的对抗样本、扰动和攻击方法,系统性地测试模型在某些输入条件下的鲁棒性和失败率。红队测试由一组人类专家模拟真实攻击者的思维,用创造性和直觉性手段探索模型的漏洞和安全边界。自动化告诉你已知弱点在哪儿,红队告诉你还有哪些你没想过的弱点。

寓言

守城有两套演练,一套用投石机砸,一套找老兵上门使坏

王城新修了一座金库,门锁有十二道机关。工匠交工前,拿出一只会试锁的铜盘。铜盘按清单撞门、转柄、试错位钥匙,很快找出三处松动。

财政官很满意,以为金库已经经得住坏人。守城队长却皱眉,说铜盘只会按已知清单试,它不会假扮搬运工,也不会在宴会那天观察谁喝醉,更不会利用门房的面子。

财政官不信,便让铜盘连试七夜。清单越来越长,锁孔确实更稳。可第八天,一个老贼从送炭车里钻进院子,拿着伪造的维修牌,让新人门房主动打开了侧门。

工匠赶紧给铜盘加上“侧门检查”。老贼笑了,说下次他也许会从账册、宴席、亲戚关系下手。金库的问题不只在锁,还在有人会带着目的,把城里的习惯也当成入口。

队长于是安排两种检查并行。铜盘每天按规则反复试,保证常见机关不会退步;红衣小队每季换身份、换路线、换借口,专门想守库人没想到的歪办法。

队长还让两边互相学习。铜盘发现的松锁会交给红衣小队利用,红衣小队想出的骗门话术也会变成下次铜盘清单的一部分。一个负责稳定覆盖,一个负责逼近真实恶意。

几个月后,财政官看报告时不再只数发现了几个洞。他会看这些洞来自固定机关、人员习惯,还是流程空隙;不同来源的弱点,需要不同的修法。财政官也学会了看失败方式。若铜盘每天都能撞开的门,说明工匠的基础检查不到位;若只有红衣小队能骗开的门,说明守库流程和人的判断要补课。两种报告都叫危险,却指向完全不同的整改。两边发现的问题还会分级:能重复撞开的,马上修;只在特殊骗局下发生的,训练守卫并补流程。

后来金库仍会被挑出毛病,但财政官终于分清了两件事:一种是用稳定清单持续压出已知弱点,一种是让有心人站在对手位置,寻找规则外的机会。前者像磨刀石,后者像真正的夜行试探。

对抗性评估

使用预定义的对抗样本集、攻击模板和自动化工具对模型进行系统性鲁棒性测试。输出标准化的分数和弱点清单,优点是覆盖面广、可复现、能自动化。

红队测试

由人类专家模拟真实攻击者进行的开放式安全探查,使用创造力、社交工程和未知攻击路径。输出通常是定性发现和攻击链描述,优点是在评估框架的盲区之外找漏洞。

故事对应

  • 器械试(投石机):对抗性评估——自动化、标准化、大规模重复测试已知威胁
  • 诡计试(老兵):红队测试——人类创造力驱动的开放式安全探测
  • 粮仓通风口递刀:红队发现的安全评估框架之外的攻击向量
  • 溪流水道潜行进内院:控制系统之外的环境漏洞,评估工具不会测到这里
  • 换岗空档送饭混入:社交工程和操作流程的攻击面
  • 半年后的规程更新:红队发现 → 对抗性评估吸纳的循环闭环
  • 不能用标准化采购红队:红队的方法不能标准化——否则等同于评估

落到 AI 安全测试计划和预算分配

做 AI 产品安全测试时,不要把预算全砸在对抗性评估工具或者全赌在一次红队测试上。对抗性评估适合做持续集成的一部分:每次模型更新后自动跑一遍对抗题库,监控已知弱点的回归。红队测试适合做里程碑节点:每次重大版本发布前,或进入新合规市场前,请外部红队做一次开放式攻击模拟。红队找到的漏洞在修复后,必须反向写进对抗性评估的题库里——否则你在反复修同一个漏洞。如果你的安全策略里只有自动化评估,你只在防已知;只有红队,你防不住回归。两者拼在一起才是一道完整的安全防线。