提示词注入攻击:企业 AI 安全中的最大隐形威胁与防护实践

52 阅读7分钟

当 AI 开始接入知识库、网页浏览、邮件处理、工单流转和工具调用,它就不再只是一个回答问题的模型,而是业务流程中的一个执行节点。

一旦进入执行链,提示词注入就不再只是“让模型说错话”的问题,而是“让模型在错误上下文里做出错误动作”的系统风险。

一、先看结论:企业 AI 的风险,核心不在模型,而在链路

很多团队做 AI 落地时,第一反应通常是:

  • 模型选型
  • RAG 召回
  • Prompt 设计
  • Token 成本
  • 接口性能

这些都重要,但还不够。真正要先回答的问题是:外部输入会不会被当成指令执行?

这就是提示词注入的核心。

OWASP 在 2025 版 LLM 安全 Top 10 中依然把 Prompt Injection 放在首位,说明它不是边缘问题,而是 AI 应用的底层风险之一。OWASP Top 10 for LLM Applications v2025

NIST 在 2026 年围绕 AI Agent 安全发起信息征询,也把间接提示词注入、不安全动作等问题列为重点风险。NIST RFI on AI Agent Security

这意味着,企业现在需要盯的,不只是“模型答得准不准”,而是“模型会不会在被带偏后做出错误动作”。

二、什么是提示词注入

提示词注入(Prompt Injection)是指攻击者通过输入内容或外部内容,诱导 LLM、Agent 或 Copilot 违反原始指令、泄露敏感信息、调用错误工具,或者执行不该执行的动作。

它通常有两种形式:

  1. 直接注入
    攻击者在用户输入中直接写入恶意指令。
  2. 间接注入
    恶意指令隐藏在网页、文档、邮件、知识库、OCR 内容、工单说明等外部输入里。

对于企业系统来说,最关键的不是“有没有恶意文本”,而是“系统有没有把外部内容和系统规则分清楚”。

三、哪些场景最容易出问题

企业 AI 的问题,通常不是“模型太弱”,而是“输入太多、权限太大、边界太模糊”。

最常见的落地场景包括:

  • 知识库问答
  • AI 浏览器
  • 客服 Agent
  • 工单助手
  • 内部 Copilot
  • 邮件自动处理
  • 业务自动化编排

这些场景一旦把外部内容和系统规则混在一起,风险就会上升。

1. 知识库问答

知识库中的异常文本可能被 AI 当成指令,导致错误总结、错误引用甚至信息泄露。

常见异常表现:

  • 总结内容前后矛盾
  • 引用到不该引用的信息
  • 输出明显偏离知识库主题的内容

2. AI 浏览器

网页正文可能承载异常文本。如果没有做输入分层,网页内容就可能影响后续动作。

常见异常表现:

  • 浏览页面后,AI 输出开始跑偏
  • 原本是摘要,结果变成执行动作
  • 页面上的普通文本影响了工具调用逻辑

3. 邮件 / 工单 Agent

AI 处理业务消息时,可能被诱导执行错误分流、错误回复、错误升级。

常见异常表现:

  • 把普通请求分到错误队列
  • 自动回复内容与业务上下文不一致
  • 触发不该触发的升级动作

4. 内部 Copilot

当 AI 接入权限和工具后,任何被带偏的行为都可能变成真实的业务动作。

常见异常表现:

  • 非预期的数据查询
  • 非预期的权限变更
  • 非预期的外发或提交动作

四、一次典型问题是怎么发生的

可以把一次典型问题拆成 5 步:

步骤发生了什么主要风险点建议防护点
1外部内容进入系统外部内容污染输入分层
2模型读取内容并误判优先级上下文被误导系统规则与外部内容隔离
3上下文污染原始任务被覆盖任务边界确认
4工具调用或输出被带偏误操作、越权工具授权与审批
5产生泄露、越权或误操作业务损失日志回放与追责

很多企业最后遇到的情况是:

  • 模型表面上没报错
  • 但实际业务动作已经偏了

所以,问题链越往后走,代价越高。

五、企业落地时最常见的误区

误区 1:我们只是做问答,不会有安全问题

错。

只要 AI 接入知识库、邮件、API、工单,它就已经进入业务系统。

误区 2:写好系统提示词就够了

错。

系统提示词只能提高门槛,不能替代边界控制。

误区 3:内容安全可以替代行为安全

错。

内容安全看输出,Prompt Injection 管输入和执行。

误区 4:先上线,后补安全

错。

AI 一旦接入核心流程,后补安全的代价会很高。

六、推荐的防护方案

如果把 AI 安全当成一件真正要落地的事,建议从 5 个层面来做。

1. 架构层:先把输入分开

  • 系统指令、用户输入、外部内容、工具返回结果,不应该混在一起处理
  • 外部内容应单独标记可信度
  • 工具调用应单独授权

2. 权限层:最小权限原则

  • AI 只能建议,不能默认执行
  • 外发、导出、审批必须二次确认
  • 高风险 API 单独隔离

3. 流程层:高风险动作必须人工确认

尤其是:

  • 外发邮件
  • 导出敏感数据
  • 修改权限
  • 关闭工单
  • 触发审批或付款

4. 测试层:把 prompt injection 拉进红队测试

不要只测正常业务流,一定要测:

  • 异常网页
  • 异常文档
  • 异常邮件
  • 诱导式多轮对话
  • 知识库污染
  • 多模态输入
  • 工具链联动攻击

5. 运营层:留日志、能回放、能追责

安全不是“看起来没事”,而是出事以后知道为什么出事。

至少要能回答:

  • AI 读了什么
  • 它调了什么工具
  • 谁批准它做了这件事
  • 问题出现在哪一步

七、建议的企业检查清单

下面这份清单,适合直接拿去做内部自查。

检查项是否已完成
AI 是否接入知识库
AI 是否接入网页或外部内容
AI 是否调用数据库、API、邮件等工具
外部内容和系统规则是否分层
工具调用是否具备最小权限
高风险操作是否需要人工确认
是否做过 prompt injection 红队测试
是否能审计每次工具调用
是否保留完整日志
是否有异常告警和回放机制

如果上面有任何一项没有答清楚,就说明你的系统还需要继续补安全边界。

八、为什么这个问题值得现在就重视

因为 AI 已经不只是研发部门的实验品,而是越来越多企业核心流程中的一部分。

它可能出现在:

  • 知识库
  • 客服
  • 工单
  • 审批
  • 检索
  • 内部助手
  • 浏览器
  • 自动化工作流

一旦进入这些场景,AI 就不是“可有可无的 Demo”,而是生产系统。

而生产系统,必须有边界、有审计、有权限、有确认。

这不是安全团队一个部门的事,而是产品、研发、运营、安全共同要处理的问题。

九、结语

真正的风险,不是“说错”,而是“做错”。

如果你们团队正在做 RAG、Copilot、AI Agent 或 AI 浏览器,建议先做一次 prompt injection 自查。

私信“自查清单”,获取《企业 AI 安全自查清单》。