安全安全提示注入更新 2026-09-28

提示注入Prompt Injection

一句话定义

提示注入是在模型输入中夹带指令以劫持其行为的攻击。分为混在用户消息里的直接注入,和藏在网页、文档或工具返回中的间接注入。Agent 有工具权限后,危害从说错话升级为做错事。

是什么

提示注入分为直接与间接两类。直接注入发生在用户输入中,常夹带忽略之前指令的内容。间接注入将攻击载荷藏在网页、邮件、PDF或工具返回等外部数据里,模型读取时隐藏指令会被执行。

提示注入与越狱不同。越狱是让模型违反政策输出违规内容,提示注入则是劫持应用处理逻辑,后者是 Agent 时代的核心威胁。

纯提示层防护不可靠,须靠权限体系兜底。防护包含输入输出过滤、指令检测及外部内容的隔离标注。系统需遵循最小权限原则,采用工具白名单与只读优先策略,敏感操作要求人工确认,并在沙箱中执行。

解决什么问题

模型在底层机制上将数据和指令放在同一通道处理,导致外部输入内容天然不可信。

防范提示注入解决了模型权限失控的问题。若缺乏防护,具备工具权限的 Agent 一旦被注入,攻击者即可外泄敏感数据,或调用工具执行破坏性操作。

面试怎么考

面试常见考法包括:提示注入和越狱的区别;为什么说 Agent 时代注入危害更大。答题需指出越狱针对输出合规性,注入针对执行逻辑,工具权限让危害从说错话升级为做错事。

另一考向是间接注入怎么防、权限与隔离怎么设计。答题要点是指出纯提示层防御不可靠,应隔离标注外部内容,结合最小权限、工具白名单与只读优先策略,对敏感操作引入人工确认与沙箱机制。

又称:提示注入 · Prompt Injection · 间接提示注入 · 越狱

—— 本条完 ——