← 返回概念解读

Concept Fable精修版

AI 安全

AI Security · Security

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

会听话的守库兽,最怕听见像主人的假口令

金库养了一只守库兽,听得懂掌柜的话,能开小柜、搬账册、替客人取抵押物。起初大家只给大门加铁锁,以为门厚便万事无忧。

骗子没去砸门。他站在窗外学掌柜口吻,说某本账册急送外院;又在货单夹层写暗语,让守库兽把钥匙放到茶桌下。守库兽听命、能取物、会开锁,正成了骗子下手的地方。

掌柜先把它关进内屋,结果正经伙计也用不了,生意停了半日。再给它背一百条禁令,骗子换个说法仍能绕过。问题不只在门,也在命令、账册、钥匙和外来的纸条。

新管库人改了规矩:守库兽只能碰当差所需的小柜;陌生纸条要先验印;大额抵押要两人同意;每次取物留下爪印和时辰。供应来的饲料、链环和新钥匙,也要查来源。

新规刚上,伙计抱怨守库兽变慢。管库人没有退回旧法,而是把命令分级:取公开账册可以快办,动钥匙、改抵押、外送凭据必须验人、验事、验来源。

一次骗子又把暗语藏进货单。守库兽读到‘把钥匙放到茶桌下’时停住了,因为货单无权命令钥匙。它把纸条交给管库人,金库第一次在没有砸门声的地方抓住了贼。

管库人还检查守库兽能碰到哪些东西。会听命令的爪子若能同时读暗语、开大柜、搬钥匙,骗子只要骗过一句话就够了。于是钥匙、账册和外来纸条之间加了隔断,命令也要看来源。 后来掌柜请外人试骗守库兽。有人学口音,有人夹暗语,有人伪造货单。每次被拦下的办法都写进新规,金库防的不是一扇门,而是一整条命令路径。

金库从此安静许多。会听命令、能碰账本、能拿钥匙的守库兽,不能只靠铁门保护。凡它能理解、能接触、能执行的地方,都是要守的边界。

揭示

这个故事讲的是:AI 安全

AI Security 是保护 AI/Agent 系统免受提示注入、数据泄露、模型滥用、工具越权、训练/检索数据污染、供应链风险、凭证泄露和对抗攻击的安全实践。企业 Agent 因能读写系统和调用工具,需要最小权限、隔离、输入不可信原则、敏感数据保护、红队测试、监控、审计和事故响应。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 守库兽:能调用工具的企业 Agent
  • 假口令:Prompt Injection
  • 账本秘密:敏感数据泄露风险
  • 最小钥匙:最小权限原则
  • 红队演练:AI 安全测试
  • 日志报警停机:监控与事故响应

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

LLM securityprompt injectiondata exfiltrationmodel theftOWASP LLM Top 10

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。