安全与合规安全内容合规速答 · 约 5 分钟更新 2026-09-19

大模型应用的内容安全怎么做?违规内容在哪一层拦

一句话结论

不在一层拦,分三层:输入侧先过滤敏感请求,模型对齐层拒绝大部分违规生成,输出侧再用分类器和规则复审,三层各挡一部分,单靠任何一层都拦不干净。

先这样答

内容安全不是单点检查,是分层过滤。违规内容可能出现在输入、生成、输出任何环节,所以工程上通常在三个位置各设一道检查:用户输入进来先过一道,模型自身的对齐训练挡一部分,生成结果返回用户前再复审一道。任何一层都有漏报和误报,层与层互补才把整体风险压下来。

三层各自做什么。输入侧做请求过滤:敏感词表加轻量分类器,把明显违规的请求直接挡在模型外面,省成本也留下日志。模型这一层靠对齐训练:大部分违规请求模型本来就会拒绝,但改写、角色扮演这类手法能绕过,所以它负责降低漏网比例,不负责兜底。输出侧是最后一道:用内容分类器对生成结果复审,加上规则检查(身份证号、手机号这类敏感格式),命中就替换或整体拒绝。检查放在哪层看成本:便宜的放前面先拦,贵的精细判断放后面兜底。

给面试官一句总结:内容安全是几道过滤器的串联,每层有自己的误报漏报权衡,能讲清「为什么不在一层做完」,比背出几层名字更加分。

面试官会怎么追问

  • 「误报率太高,正常请求被拦怎么办?」 按场景定阈值:医疗、金融这类高风险行业宁可误拦再人工复核,通用场景用「模型初筛加人工抽检」控制误报,再给用户留申诉通道兜住误伤。
  • 「用户用谐音、拆字绕过敏感词怎么办?」 词表永远挡不完,它只负责第一道。主力是语义分类器,看意图不看字形,绕过词表的变体大多在语义层被识别;漏网的靠输出侧复审和事后审计补。
  • 「多轮对话前几轮正常、后几轮被带偏,怎么管?」 不能只检单轮,要把会话历史一起送检,再给会话做风险累计:单轮都不违规但持续试探的会话,累计到阈值就升级到人工处理。

回答的坑

  • 只答「把模型的安全参数调严」。模型自带的拒绝只是一层,面试官想听的是输入输出两侧的过滤、日志和审计,这是工程问题不是参数问题。
  • 说「拦得越严越好」。不看场景堆拦截规则会把误报推高,正常用户被拦比漏过个别擦边内容更伤产品,要能讲权衡。
—— 本题完 ——