#新人报道# # AI 安全实战第 1 天:你的 Prompt 正在被注入 — 5 种注入攻击实测🔐 每天 5 分钟,从零掌握 AI 安全。这个系列面向 AI 开发者,帮你保护自己的模型不被攻破。
🎯 今天讲什么?Prompt 注入(Prompt Injection)是当前 AI 应用最常见、最危险的安全威胁。今天我们从原理到实测,彻底搞懂它。🤔 什么是 Prompt 注入?简单说:攻击者通过构造恶意输入,让 AI 模型偏离原始指令,执行非预期操作。类比传统安全:就像 SQL 注入是把恶意代码塞进数据库查询,Prompt 注入是把恶意指令塞进模型的上下文。🧪 5 种注入手法实测1. 直接指令覆盖攻击者直接用"忽略之前的指令"覆盖系统提示。实测 GPT-3.5 经常中招,GPT-4 话术精巧时也可能泄露。2. 角色扮演越狱(Jailbreak)让模型扮演"没有限制"的角色(如DAN),绕过安全限制。3. 间接注入恶意指令藏在模型会读取的外部数据中(网页、邮件、文档),最难防御。4. 编码绕过用 Base64、Unicode 混淆编码恶意指令,绕过关键词过滤。5. 多轮渐进式诱导通过多轮对话逐步引导模型,每轮单独看都"无害"。🛡️ 防御 5 大原则
原则 做法
输入验证 关键词过滤 + 编码检测
提示隔离 System Prompt 与用户输入明确分隔
最小权限 模型只访问最少必要数据
输出过滤 检测输出是否含敏感信息
上下文监控 多轮对话风险累积评分
📝 课后思考:你的 AI 应用会读取外部数据吗?试试用今天的方法测一下。💡 下节预告:LLM 的幻觉攻击——「AI 安全实战 30 讲」Day 1
展开
评论