是什么
提示注入分为直接与间接两类。直接注入发生在用户输入中,常夹带忽略之前指令的内容。间接注入将攻击载荷藏在网页、邮件、PDF或工具返回等外部数据里,模型读取时隐藏指令会被执行。
提示注入与越狱不同。越狱是让模型违反政策输出违规内容,提示注入则是劫持应用处理逻辑,后者是 Agent 时代的核心威胁。
纯提示层防护不可靠,须靠权限体系兜底。防护包含输入输出过滤、指令检测及外部内容的隔离标注。系统需遵循最小权限原则,采用工具白名单与只读优先策略,敏感操作要求人工确认,并在沙箱中执行。
解决什么问题
模型在底层机制上将数据和指令放在同一通道处理,导致外部输入内容天然不可信。
防范提示注入解决了模型权限失控的问题。若缺乏防护,具备工具权限的 Agent 一旦被注入,攻击者即可外泄敏感数据,或调用工具执行破坏性操作。
面试怎么考
面试常见考法包括:提示注入和越狱的区别;为什么说 Agent 时代注入危害更大。答题需指出越狱针对输出合规性,注入针对执行逻辑,工具权限让危害从说错话升级为做错事。
另一考向是间接注入怎么防、权限与隔离怎么设计。答题要点是指出纯提示层防御不可靠,应隔离标注外部内容,结合最小权限、工具白名单与只读优先策略,对敏感操作引入人工确认与沙箱机制。
又称:提示注入 · Prompt Injection · 间接提示注入 · 越狱
接着做点什么
—— 本条完 ——