先这样答
结论是,我会把短视频内容理解 Agent 设计成多模态模型协作的架构。Coordinator 负责编排专业模型。LLM 负责融合不同模态的结果,并完成推理。
第一块是视觉理解。系统先抽取关键帧,再调用 VLM 识别场景、物体、OCR 内容,以及人物的脸部表情。第二块是音频理解。系统使用 ASR 转写语音,结合音乐识别和情感分析,得到语音与音乐信息。第三块是文本理解。系统处理标题、评论和弹幕,使用 NLU 识别其中的语义与情绪。
第四块是跨模态对齐。系统比较视频画面、音频和文本是否一致,也可以用 CLIP 类方法检测标题党。第五块是标签生成。系统把理解结果整理成结构化标签,覆盖类别、情感、质量和安全。整体架构由 Coordinator 调度这些专业模型,再由 LLM 汇总结果。面对日亿级视频,主要挑战是流式处理和分级策略,需要让不同视频进入合适的处理流程。
面试官会怎么追问
-
「为什么不能只用一个多模态大模型完成全部任务?」
短视频包含视觉、音频和文本等不同信息。专业模型分别处理各自擅长的任务,更容易覆盖关键帧、ASR、音乐识别和文本理解。Coordinator 负责组织结果,LLM 再做融合推理。 -
「跨模态对齐具体要解决什么问题?」
它要检查不同模态表达的内容是否一致。系统可以比较标题和视频内容,使用 CLIP 类方法检测标题党。它也可以结合画面、音频和文本结果,减少只看单一模态带来的误判。 -
「日亿级视频下,你最关注哪个工程挑战?」
我最关注流式处理和分级策略。系统需要按处理流程持续处理视频,并让不同视频使用合适的处理级别。这样才能应对视频规模带来的处理压力。
回答的坑
- 只讲视觉模型,不讲音频、文本和跨模态对齐,会遗漏短视频内容理解的核心部分。
- 只罗列模型名称,不说明 Coordinator 与 LLM 的分工,也没有回答日亿级视频的处理挑战。
同系列的题
这家公司的面经实录