先这样答
主流做法是把视频变成图来处理:先从视频里采样一批帧,每一帧走视觉编码器变成一串 Token,再附上时间位置信息,和文本一起送进语言模型。所以模型读到的不是连续画面,而是一条按时间排列的帧序列,它对运动的理解完全取决于采样密度。
成本账很好算:单帧 Token 乘帧数。单帧几十到几千 Token,乘上几十上百帧,总量很快就超过同样主题的一张图几个数量级。两帧之间的快速变化还可能整个丢失,数物体个数、看节奏这类任务目前是公认弱项。长视频一般要分层处理:先粗筛关键片段,再对选中的部分精读,或者把每帧压缩成更少的 Token,核心都是控制进上下文的总量。
给面试官的总结:模型读的是采样后的帧序列,帧率决定时间感知的上限,帧数决定成本,两句话能覆盖大部分追问。
面试官会怎么追问
- 「模型能看到连贯动作吗?」 取决于采样密度。两帧之间发生的快速变化可能完全丢失,所以对动作时序敏感的任务要明确说明这是采样机制带来的限制,不是改提示词能解决的。
- 「长视频怎么处理?」 分层是常见思路:先用低分辨率粗筛定位关键片段,再对候选片段精读;或者维护一个跨帧的记忆表示,只把摘要带进上下文。共同点是把进窗口的内容压到必要范围。
- 「视频里的声音怎么办?」 常见做法是音轨先经语音识别转成文字,和画面 Token 一起给模型,两条信息通道分开处理再拼接。提到这一层,说明你知道视频不只是画面流。
回答的坑
- 说模型「播放」了视频。它看到的是采样帧序列,帧率和采样策略决定上限,这个细节最能区分背概念和理解机制。
- 按单张图的价格估算视频成本。帧数是乘数,同样分辨率下视频成本高出一到两个数量级很正常。
同系列的题
—— 本题完 ——