视频理解 Agent 和图像理解 Agent 的技术差异在哪?长视频怎么处理?
先这样答
视频理解比图像理解多了一个时间维度,带来四个新问题。第一,输入量爆炸:一分钟视频按常规采样就是上百帧,每帧再编码成几百个视觉 token,直接超出上下文预算。第二,时序建模:理解「他先拿起手机然后放下」需要跨帧的顺序信息,单帧模型无能为力。第三,跨帧追踪:同一个物体在相邻帧里位置和形态变化,要维持身份一致。第四,信息密度不均:关键动作发生在几秒钟内,大部分帧是冗余的。
处理长视频的常用策略分三档。采样侧:关键帧抽取,用帧间差异或场景切换检测挑出信息量大的帧,静止段落只留代表帧。编码侧:帧内压缩视觉 token 数量,相邻帧做时序池化合并相似 token。理解侧:分层摘要,先把视频切成段落做局部理解,再把段落摘要组织成时间线供全局推理,对齐了人看视频先浏览后细看的方式。
评估上除了单帧的理解准确率,还要看多帧一致性:同一物体在问题涉及的不同帧之间身份不乱;时序问答准确率:关于先后顺序的问题能答对;长视频检索:根据描述定位到时间段。
面试官会怎么追问
- 「关键帧抽取用信号还是用模型?」 两级。先用帧间差分、直方图距离这类廉价信号过滤明显冗余的帧,量下来之后再用轻量模型给候选帧打信息量分。全程用模型算力撑不住。
- 「时序池化会丢快速动作吗?」 会。相邻帧合并的前提是内容相似,快速动作恰恰发生在帧间差异大的时刻,所以合并要有时变化感知:差异大的帧不合并、单独保留。这是召回和成本的权衡点。
- 「视频 Agent 的典型产品任务是什么?」 内容审核(识别违规片段)、视频检索(找包含某动作的片段)、剪辑助手(自动找高光片段)、监控告警(异常行为检测)。回答时举一个具体任务的完整链路比泛泛列举加分。
回答的坑
- 把视频理解说成「多跑几遍图像理解」。时间维度的建模和成本控制才是差异核心。
- 不提 token 预算的量化概念。能说出「一分钟视频多少帧、每帧多少 token、总共多长」的估算,才算真做过。
同系列的题
—— 本题完 ——