先这样答
大模型安全可以按四层理解:模型说什么、模型被输入什么、数据流过什么、模型做什么。这四层分别对应内容安全、提示词注入与越权、数据安全、行为安全。面试时我会先给出这个框架,再说每层关注的风险。这样回答不会把安全只等同于模型生成的内容,也能把 Agent 的动作纳入讨论。
第一层看模型说什么。内容安全关注模型是否生成有害内容。第二层看模型被输入什么。提示词注入与越权关注输入是否诱导模型干坏事。这两层容易混在一起,但观察对象不同:前者看生成结果,后者看输入对模型的诱导。回答时要把两者分开,否则只说输出有害,会漏掉风险从哪里进入。
第三层看数据流过什么。数据安全关注训练与推理数据的隐私泄露。第四层看模型做什么。行为安全关注 Agent 是否滥用工具,或执行不可逆动作。数据安全不能只看训练数据,推理数据也在范围内。行为安全也不能只看模型说了什么,因为 Agent 还会做动作。我的收束句是:用四层定位风险,先分清输入、输出、数据和动作,再讨论具体问题。
面试官会怎么追问
- 「内容安全和提示词注入有什么区别?」 内容安全看模型生成了什么,核心风险是生成有害内容。提示词注入看模型收到了什么,核心风险是有人通过输入诱导模型干坏事。一个看输出,一个看输入,不能因为最终都可能表现为不安全的回答,就把两者合并。
- 「数据安全为什么要同时看训练和推理?」 因为底稿中的数据安全同时覆盖训练数据和推理数据的隐私泄露。只谈训练数据,会漏掉推理时流过模型的数据。我会先说明这两类数据都在范围内,再把讨论限定在隐私泄露上。
- 「Agent 的安全和普通大模型有什么不同?」 我会把重点放在模型做什么,而不只放在模型说什么。Agent 的行为安全关注工具滥用与不可逆动作。即使回答本身没有有害内容,也不能据此判断它后续的动作安全。
回答的坑
- 只谈生成有害内容,会漏掉输入诱导、数据隐私泄露和 Agent 动作。
- 把提示词注入、数据泄露和工具滥用混成一类,会说不清风险发生在哪一层。
同系列的题
—— 本题完 ——