当 AI 开始接入知识库、网页浏览、邮件处理、工单流转和工具调用,它就不再只是一个回答问题的模型,而是业务流程中的一个执行节点。
一旦进入执行链,提示词注入就不再只是“让模型说错话”的问题,而是“让模型在错误上下文里做出错误动作”的系统风险。
一、先看结论:企业 AI 的风险,核心不在模型,而在链路
很多团队做 AI 落地时,第一反应通常是:
- 模型选型
- RAG 召回
- Prompt 设计
- Token 成本
- 接口性能
这些都重要,但还不够。真正要先回答的问题是:外部输入会不会被当成指令执行?
这就是提示词注入的核心。
OWASP 在 2025 版 LLM 安全 Top 10 中依然把 Prompt Injection 放在首位,说明它不是边缘问题,而是 AI 应用的底层风险之一。OWASP Top 10 for LLM Applications v2025
NIST 在 2026 年围绕 AI Agent 安全发起信息征询,也把间接提示词注入、不安全动作等问题列为重点风险。NIST RFI on AI Agent Security
这意味着,企业现在需要盯的,不只是“模型答得准不准”,而是“模型会不会在被带偏后做出错误动作”。
二、什么是提示词注入
提示词注入(Prompt Injection)是指攻击者通过输入内容或外部内容,诱导 LLM、Agent 或 Copilot 违反原始指令、泄露敏感信息、调用错误工具,或者执行不该执行的动作。
它通常有两种形式:
- 直接注入
攻击者在用户输入中直接写入恶意指令。 - 间接注入
恶意指令隐藏在网页、文档、邮件、知识库、OCR 内容、工单说明等外部输入里。
对于企业系统来说,最关键的不是“有没有恶意文本”,而是“系统有没有把外部内容和系统规则分清楚”。
三、哪些场景最容易出问题
企业 AI 的问题,通常不是“模型太弱”,而是“输入太多、权限太大、边界太模糊”。
最常见的落地场景包括:
- 知识库问答
- AI 浏览器
- 客服 Agent
- 工单助手
- 内部 Copilot
- 邮件自动处理
- 业务自动化编排
这些场景一旦把外部内容和系统规则混在一起,风险就会上升。
1. 知识库问答
知识库中的异常文本可能被 AI 当成指令,导致错误总结、错误引用甚至信息泄露。
常见异常表现:
- 总结内容前后矛盾
- 引用到不该引用的信息
- 输出明显偏离知识库主题的内容
2. AI 浏览器
网页正文可能承载异常文本。如果没有做输入分层,网页内容就可能影响后续动作。
常见异常表现:
- 浏览页面后,AI 输出开始跑偏
- 原本是摘要,结果变成执行动作
- 页面上的普通文本影响了工具调用逻辑
3. 邮件 / 工单 Agent
AI 处理业务消息时,可能被诱导执行错误分流、错误回复、错误升级。
常见异常表现:
- 把普通请求分到错误队列
- 自动回复内容与业务上下文不一致
- 触发不该触发的升级动作
4. 内部 Copilot
当 AI 接入权限和工具后,任何被带偏的行为都可能变成真实的业务动作。
常见异常表现:
- 非预期的数据查询
- 非预期的权限变更
- 非预期的外发或提交动作
四、一次典型问题是怎么发生的
可以把一次典型问题拆成 5 步:
| 步骤 | 发生了什么 | 主要风险点 | 建议防护点 |
|---|---|---|---|
| 1 | 外部内容进入系统 | 外部内容污染 | 输入分层 |
| 2 | 模型读取内容并误判优先级 | 上下文被误导 | 系统规则与外部内容隔离 |
| 3 | 上下文污染 | 原始任务被覆盖 | 任务边界确认 |
| 4 | 工具调用或输出被带偏 | 误操作、越权 | 工具授权与审批 |
| 5 | 产生泄露、越权或误操作 | 业务损失 | 日志回放与追责 |
很多企业最后遇到的情况是:
- 模型表面上没报错
- 但实际业务动作已经偏了
所以,问题链越往后走,代价越高。
五、企业落地时最常见的误区
误区 1:我们只是做问答,不会有安全问题
错。
只要 AI 接入知识库、邮件、API、工单,它就已经进入业务系统。
误区 2:写好系统提示词就够了
错。
系统提示词只能提高门槛,不能替代边界控制。
误区 3:内容安全可以替代行为安全
错。
内容安全看输出,Prompt Injection 管输入和执行。
误区 4:先上线,后补安全
错。
AI 一旦接入核心流程,后补安全的代价会很高。
六、推荐的防护方案
如果把 AI 安全当成一件真正要落地的事,建议从 5 个层面来做。
1. 架构层:先把输入分开
- 系统指令、用户输入、外部内容、工具返回结果,不应该混在一起处理
- 外部内容应单独标记可信度
- 工具调用应单独授权
2. 权限层:最小权限原则
- AI 只能建议,不能默认执行
- 外发、导出、审批必须二次确认
- 高风险 API 单独隔离
3. 流程层:高风险动作必须人工确认
尤其是:
- 外发邮件
- 导出敏感数据
- 修改权限
- 关闭工单
- 触发审批或付款
4. 测试层:把 prompt injection 拉进红队测试
不要只测正常业务流,一定要测:
- 异常网页
- 异常文档
- 异常邮件
- 诱导式多轮对话
- 知识库污染
- 多模态输入
- 工具链联动攻击
5. 运营层:留日志、能回放、能追责
安全不是“看起来没事”,而是出事以后知道为什么出事。
至少要能回答:
- AI 读了什么
- 它调了什么工具
- 谁批准它做了这件事
- 问题出现在哪一步
七、建议的企业检查清单
下面这份清单,适合直接拿去做内部自查。
| 检查项 | 是否已完成 |
|---|---|
| AI 是否接入知识库 | |
| AI 是否接入网页或外部内容 | |
| AI 是否调用数据库、API、邮件等工具 | |
| 外部内容和系统规则是否分层 | |
| 工具调用是否具备最小权限 | |
| 高风险操作是否需要人工确认 | |
| 是否做过 prompt injection 红队测试 | |
| 是否能审计每次工具调用 | |
| 是否保留完整日志 | |
| 是否有异常告警和回放机制 |
如果上面有任何一项没有答清楚,就说明你的系统还需要继续补安全边界。
八、为什么这个问题值得现在就重视
因为 AI 已经不只是研发部门的实验品,而是越来越多企业核心流程中的一部分。
它可能出现在:
- 知识库
- 客服
- 工单
- 审批
- 检索
- 内部助手
- 浏览器
- 自动化工作流
一旦进入这些场景,AI 就不是“可有可无的 Demo”,而是生产系统。
而生产系统,必须有边界、有审计、有权限、有确认。
这不是安全团队一个部门的事,而是产品、研发、运营、安全共同要处理的问题。
九、结语
真正的风险,不是“说错”,而是“做错”。
如果你们团队正在做 RAG、Copilot、AI Agent 或 AI 浏览器,建议先做一次 prompt injection 自查。
私信“自查清单”,获取《企业 AI 安全自查清单》。