先这样答
结论是:规则审核和 Agent 分层协作。第一层用规则引擎加分类模型快速过滤。它的延迟低于 100ms,能覆盖明确违规内容的九成以上。
第二层处理灰度内容。系统把规则引擎和分类模型无法直接判断的内容交给多模态 Agent。Agent 结合视频内容理解语境,也判断隐喻和阴阳怪气。它还要输出推理链,方便后续审计。
第三层处理不确定结果。如果 Agent 也无法确认,就升级给人工审核。这个方案的价值主要在擦边球内容。规则可以处理边界清楚的违规,Agent 补充规则难以表达的语境判断,人工负责最终确认。
Agent 的问题是延迟高。因此,它只适合非实时审核。实时场景仍然要优先使用规则引擎和分类模型。面试里要讲清楚分层关系:规则负责快速过滤,Agent 负责深度理解,人工处理不确定情况。
面试官会怎么追问
-
「为什么不直接让 Agent 审核所有视频?」 Agent 的延迟高,无法适合实时审核。规则引擎加分类模型能在低于 100ms 内快速过滤明确违规内容。让 Agent 处理灰度内容,更符合它的使用位置。
-
「Agent 在这个方案里解决了什么问题?」 Agent 主要处理擦边球内容。它能结合视频内容理解语境、隐喻和阴阳怪气。规则和分类模型难以直接判断这类内容时,可以让 Agent 做进一步分析。
-
「Agent 给出的结果不确定时,系统怎么处理?」 系统把不确定结果升级给人工审核。Agent 需要输出推理链,方便人工理解判断过程,也方便后续审计。人工负责确认无法自动判断的内容。
回答的坑
-
不要把 Agent 放在所有视频的第一层,否则会忽略它延迟高、只适合非实时审核的限制。
-
不要只说 Agent 能理解复杂语境,还要说明推理链、人工升级和规则快速过滤的分工。
同系列的题
这家公司的面经实录