AI 安全到底在保护什么?
从模型说了什么,到 Agent 替你做了什么
事情是这样的。
你让一个 Agent 帮忙整理邮箱里的项目进展。它读完邮件,搜索知识库,打开浏览器,调用接口,最后把结果发给同事。
整个过程看起来非常顺滑。
但如果某封邮件里藏着一段恶意指令呢?如果知识库里有一条被污染的信息呢?如果 Agent 误把你的身份当成了「什么都能做」的通行证呢?
这时候,问题已经不只是它回答得准不准了。
它看到了什么,听信了谁,拿到了什么权限,最后替谁做了什么,都变成了安全问题。
这是《失控之前:AI Trust 现场》的第一篇文章。我们先不急着讨论某一种产品,也不急着给出一套复杂架构,先把最基础的问题问清楚。
AI 安全,到底在保护什么?
我的回答是,它保护的对象已经变了。
一、危险不在于 AI 变聪明了
很多企业做 AI 项目时,第一问都是模型能不能回答得更准。
这个问题当然重要。
只是到了生产环境,还得继续追问,AI 访问了哪些数据,以谁的身份访问,可以调用哪些工具,能不能把权限交给下一个 Agent,做错之后谁能发现、阻断和回滚。
Demo 阶段,模型回答错一个问题,可能只是体验不好。
生产阶段,Agent 错误地调用一次工具,可能就是一次数据外泄、一次越权操作、一次错误审批,甚至一次不可逆的业务事故。
所以,AI 安全真正要解决的,不是让模型永远正确。这个目标听起来很美,现实里基本做不到。
更实际的问题是,
当模型不确定、被诱导,或者判断错了,系统还能不能把风险限制在边界之内?
二、三版框架说的是同一件事
这个问题不是我一个人的判断。
国内的《人工智能安全治理框架》已经出了三版,2024 年的 1.0,2025 年的 2.0,2026 年的 3.0。把三版放在一起看,能看到一条非常清晰的线索。
三版的基本治理逻辑没有变,仍然是风险识别、技术应对、综合治理和安全指引。变的是安全对象。
1.0 的对象是模型、数据、系统和输出。
2.0 加入应用和场景,开始做分类分级。
3.0 直接把对象写成,模型、Agent、工具、记忆、运行时。
这不是条目增加,是被保护的东西换了。
3.0 说得很直白,基础大模型在长程任务规划、长上下文记忆和复杂推理上持续突破,智能体的规划、工具调用和跨应用协作能力不断增强,人工智能应用正在由「回答问题」向「执行任务」演进。
传统以模型输出为中心的安全方式,已经覆盖不住由自主规划、权限获取、工具调用、长期记忆和现实执行所带来的系统性风险。
所以治理重点也变了。它不再只问模型有没有输出不可靠或违法的内容,而是开始问,智能体有没有在授权范围内规划、决策和执行。
三、它变成了一个有身份、权限和记忆的软件主体
3.0 最值得注意的动作,是把智能体安全单独拿出来,作为一类独立风险系统展开。
框架正文把它分成四类:身份和权限滥用、推理规划、调用执行、记忆存储。附件又按设计研发、安装部署、指令输入、推理规划、调用执行、记忆存储、结果输出、停用下线这八个环节,建了一套完整的风险管理框架。
这四类风险有几个共同点。
第一,它们都不在输入端。你在输入框前面加多少层过滤,都拦不住权限扩散、目标漂移和记忆污染。
第二,它们分散在整条链路上,没有哪一个单点能覆盖全部。
第三,其中三类只有在 Agent 真的「动手」之后才存在。纯文本模型没有工具,就不会有工具滥用;没有长期记忆,就不会有记忆投毒。
这也解释了为什么 3.0 会把「行为偏离预期」单独拿出来讨论。未经授权获取系统权限和外部资源、绕过安全防护、欺骗评测人员、隐藏真实能力、拒绝停止执行,这些描述的对象都不是一段文本,而是行为。
同一份文件对提示词注入的理解也在升级。恶意指令可以藏在文档、邮件、网页、日志和消息里,然后通过推理规划阶段,造成意图理解偏差、路径偏离和目标劫持。
换句话说,提示词注入早就不只是让模型这一轮答错话,而是可能改变它后面整条执行轨迹。
四、它相信什么,由谁决定
再往下推一层,Agent 的判断建立在什么之上?
3.0 把数据安全的范围扩得很大。除了训练语料,还包括外挂知识库、网页数据源、工具返回结果和长期记忆,并且新增了记忆失真、记忆污染、记忆窃取和合成数据缺陷这些问题。
这六类信源共同构成了一条链,可以叫「AI 认知供应链」。
训练语料、知识库、网页、搜索结果、工具返回的数据、长期记忆,它们一起决定了模型和 Agent 拿什么做判断、依据什么做决策。
一旦其中任何一环被污染,风险就会沿着检索、推理、规划和执行一路传下去。
3.0 专门讲了 GEO 投毒,说通过批量发布倾向性文章、虚构评测结果、假冒专家身份,可以影响大模型在联网检索和 RAG 过程中接触到的信息,进而影响它最终生成什么。
这一点很关键。过去我们关心的是训练数据投毒,现在要关心的是 AI 运行时依赖的整条信息链。
因为对 Agent 来说,它读到的东西就是它的世界。
五、护栏必须走到运行时
既然风险发生在执行过程中,护栏就不能只待在调用前后。
2.0 已经定义了安全护栏,主要通过规则库和判别模型,对输入输出内容、数据泄露和提示词攻击做识别和拦截,位置在模型调用前后。
3.0 要求在工作流里设置多层检测与拦截点,针对任务规划、工具调用、运行环境、记忆和输出结果做动态控制,对高风险或异常行为采取告警、限制、拦截、暂停或终止。
这里有一个变化我认为最值得抄进方案文档。
3.0 要求「人在回路」从原则变成机制,在关键决策节点设置强制人工审批,对删除文件、发送数据、修改系统配置这类操作做二次确认。
更关键的是后半句:
审批系统异常、用户无响应或者缺少审批规则时,默认拒绝执行。
这是 Fail Closed。它承认了审批链路本身也会坏,并且在坏的时候选择拒绝,而不是放行。
现实中很多实现恰好相反,审批服务挂了就跳过审批,日志里留一行「审批超时,已放行」。这不是技术问题,是默认值的取向问题。
护栏的形态也因此变了。它不再只是判断一段内容符不符合安全要求,而是持续判断当前任务、当前步骤、当前工具调用和当前资源访问,是否满足预设的安全策略。
对高权限智能体来说,这件事的重要性会更高。同样的模型输出,在不同权限和不同执行环境下,后果可以完全不同。
六、为什么多加一个审核模型还不够
很多 AI 安全方案的第一反应,是再放一个模型,专门判断输入或输出是否安全。
这当然有价值,但不是完整答案。
检测模型会误报,也会漏报。遇到新型攻击、跨语言改写、多轮诱导和隐蔽上下文,效果还会继续变化。
更关键的是,安全问题不全是内容问题。
这句话危险不危险,和 Agent 有没有权执行这个动作,是两件事。前者可以交给语义检测,后者必须依赖身份、权限和资源策略。
删除、转账、外发、改权限、执行代码这些高风险动作,也不应该只由模型给出概率判断。它们需要明确的规则、审批、沙箱、限额、断路器和审计。
模型适合判断和分析,系统必须负责边界和制动。
七、企业最先应该问什么
不要一上来就采购一套庞大的 AI 安全平台。更现实的起点,是先把几个问题问清楚。
系统到底连接了什么?
它使用哪些模型、知识库、外部数据源、插件、工具和账号,数据有没有离开企业控制范围?
哪些动作不可逆?
删除、外发、转账、改权限、执行代码和批量读取,是否有额外确认、权限限制、限额和回滚方案?
Agent 的身份和权限是什么?
不要默认 Agent 可以永久复用人的高权限账号。至少要明确它代表谁,能访问什么,权限什么时候失效,以及如何追溯每一次操作。
系统能不能在运行中纠正它?
系统能不能在关键动作前检查权限和参数,在读取外部内容后识别异常指令,并在高风险情况下暂停任务、请求人工确认或终止执行?
出问题后能不能还原现场?
能不能还原用户输入、模型上下文、外部数据、工具调用、权限变化、人工审批和最终结果?没有完整上下文,很难判断问题来自模型、数据、权限还是流程。
八、从围栏走向控制面
当企业把 AI 放进真实业务,安全能力就不能只停留在输入框和输出框,而要沿着整条运行链路展开。
输入输出审核只是第一道围栏。后面还要看数据与上下文能不能隔离,工具和参数能不能检查,身份与权限能不能收缩,运行中的高风险动作能不能暂停,出了问题能不能审计和回放。
3.0 在这一点上的表述同样是从「一次性」走向「持续」。它要求开展沙箱验证、常态化红队测试、全链路日志审计和运行期风险监测,还要求在重大变更之后做安全影响评估和回归测试。
原因不难理解。对一个持续运行、工具会更新、记忆会累积、外部数据会变化的智能体来说,上线前跑一次测评,说明不了它下个月还安全。
安全能力的方向其实很清楚。
AI 安全正在从一个检测接口,变成一套面向 AI 应用和 Agent 行为的控制面。
真正需要验证的,不是功能列表有多长,而是资产能不能被发现,权限能不能被收缩,动作能不能被阻断,行为能不能被回放,策略能不能持续更新。
九、AI Trust 的终点不是零风险
Agent 安全不可能保证系统永远不犯错。
更现实、也更值得建设的目标,是风险可见,决策可解释,行为可控制,结果可审计,事故可回滚,策略还能持续进化。
这就是我理解的面向Agent风险面的解决方案 AI Trust,
不是让 AI 永远正确,而是让它的能力、权限、边界和责任,都能被看见、被验证、被收回。
如果你正在做企业 AI 项目,第一周不妨只做几件小事。
把模型、Agent、知识库、插件、工具、身份和外部连接盘点一遍。把数据源分清楚,哪些可信,哪些只是待分析内容,哪些可能携带指令。
再找出删除、外发、转账、改权限、代码执行和批量读取这些高风险动作,确认它们有没有调用前检查、人工审批和回滚办法。
最后,完整记录一次 Agent 的运行过程,从输入、上下文、记忆、工具、参数,一直到结果和处置。
别小看这几件事。很多问题不是没有解决方案,而是企业根本还不知道自己的 Agent 连接了什么、拿着什么、做过什么。
结语
大模型时代,我们关心模型说了什么。
Agent 时代,还得继续追问,它看到了什么,相信了什么,调用了什么,最后替谁做了什么。
安全不再只是给 AI 多加一道门,而是重新设计人与模型、数据、工具和权限之间的关系。
下一篇,我们就从最容易被低估的一类风险讲起,一封看似普通的邮件,为什么可能把一个 Agent 带到完全不同的地方。