五厂面经真题集商汤科技面经高频商汤考点视频理解长上下文速答 · 约 5 分钟更新 2026-09-30

视频理解 Agent 和图像理解 Agent 的技术差异在哪?长视频怎么处理?

一句话结论

视频多了时间维度,要解决帧采样、时序建模、跨帧追踪和长视频 token 爆炸;工程上按关键帧抽取加分层摘要控制成本,用多帧一致性指标评估。

视频理解 Agent 和图像理解 Agent 的技术差异在哪?长视频怎么处理?

先这样答

视频理解比图像理解多了一个时间维度,带来四个新问题。第一,输入量爆炸:一分钟视频按常规采样就是上百帧,每帧再编码成几百个视觉 token,直接超出上下文预算。第二,时序建模:理解「他先拿起手机然后放下」需要跨帧的顺序信息,单帧模型无能为力。第三,跨帧追踪:同一个物体在相邻帧里位置和形态变化,要维持身份一致。第四,信息密度不均:关键动作发生在几秒钟内,大部分帧是冗余的。

处理长视频的常用策略分三档。采样侧:关键帧抽取,用帧间差异或场景切换检测挑出信息量大的帧,静止段落只留代表帧。编码侧:帧内压缩视觉 token 数量,相邻帧做时序池化合并相似 token。理解侧:分层摘要,先把视频切成段落做局部理解,再把段落摘要组织成时间线供全局推理,对齐了人看视频先浏览后细看的方式。

评估上除了单帧的理解准确率,还要看多帧一致性:同一物体在问题涉及的不同帧之间身份不乱;时序问答准确率:关于先后顺序的问题能答对;长视频检索:根据描述定位到时间段。

面试官会怎么追问

  • 「关键帧抽取用信号还是用模型?」 两级。先用帧间差分、直方图距离这类廉价信号过滤明显冗余的帧,量下来之后再用轻量模型给候选帧打信息量分。全程用模型算力撑不住。
  • 「时序池化会丢快速动作吗?」 会。相邻帧合并的前提是内容相似,快速动作恰恰发生在帧间差异大的时刻,所以合并要有时变化感知:差异大的帧不合并、单独保留。这是召回和成本的权衡点。
  • 「视频 Agent 的典型产品任务是什么?」 内容审核(识别违规片段)、视频检索(找包含某动作的片段)、剪辑助手(自动找高光片段)、监控告警(异常行为检测)。回答时举一个具体任务的完整链路比泛泛列举加分。

回答的坑

  • 把视频理解说成「多跑几遍图像理解」。时间维度的建模和成本控制才是差异核心。
  • 不提 token 预算的量化概念。能说出「一分钟视频多少帧、每帧多少 token、总共多长」的估算,才算真做过。
—— 本题完 ——