做一个文生视频产品(类似海螺 AI 这类),从用户输入到成片的技术链路是什么?难在哪?
先这样答
用户输入一句话,成片要几十秒到几分钟,中间是一条多阶段流水线。第一步意图解析:把口语化描述规范化,补全风格、画幅、节奏这些生成参数,识别违禁内容。第二步分镜脚本:大模型把一句话扩展成镜头列表,每个镜头有自己的画面描述、时长和转场。第三步逐镜头生成:文本或首帧图驱动视频模型生成每个镜头的片段,单个镜头时长有限,长视频靠多镜头拼接。第四步后处理:转场衔接、配音配乐、字幕对齐。第五步质量审核:技术质检加内容安全审核,通过后交付。
工程难点有四个。镜头间一致性:主角的长相、服装、场景光照在不同镜头里要保持统一,靠参考图约束加生成参数锁定来缓解,完全解决还做不到。失败重试成本:视频生成单次几分钟、成本高,失败重试的预算要精细控制,先出低分辨率预览确认再出成片是常用的两级策略。时长与算力:生成时间和成本随时长超线性增长,产品上用免费短片段加付费长片的分层设计。内容安全:视频的违规检测要比图片多考虑动作和语境,先解帧成图片流过检测器,再对整体语境过一遍。
面试官会怎么追问
- 「镜头一致性具体怎么约束?」 生成首镜头后,把首帧或角色参考图作为后续镜头的条件输入,让模型在同一个外观约束下生成;脚本层把角色的外观描述固定成模板字段,每个镜头复用同一段描述。
- 「为什么先出预览再出成片?」 成片成本是预览的几十倍。预览阶段暴露用户意图理解偏差和明显崩坏,用户确认或调整后再花大算力,整体成本期望大幅下降。
- 「怎么度量生成质量?」 自动指标看帧间稳定性、文本与画面的语义一致性评分;人工抽检看专业维度的崩坏率(手部、面部、物理合理性);业务上看用户重试率和成片采纳率。
回答的坑
- 把文生视频说成「一个模型直接出片」。生产链路是多阶段流水线,模型只是其中一环。
- 不算成本账。视频生成的单次成本和时长关系,是产品设计的核心约束。
同系列的题
—— 本题完 ——