五厂面经真题集蔚来面经高频高频考点世界模型自动驾驶速答 · 约 6 分钟更新 2026-09-30

自动驾驶里的「世界模型」是什么?和语言模型、和传统感知规划有什么区别?

一句话结论

世界模型是学习环境演化规律的视频预测式生成模型,用「预测下一帧」的方式获得对物理场景的理解;它补传统感知规划链路对长尾场景和后果推演的短板,落地难点是可控性、实时性和评测。

自动驾驶里的「世界模型」是什么?和语言模型、和传统感知规划有什么区别?

先这样答

概念先说清:语言模型学的是「下一个词是什么」,世界模型学的是「下一帧画面是什么」。给它当前的场景视频和自车动作,它预测接下来画面怎么变化——车流怎么移动、行人往哪走、障碍物轨迹如何演化。要做准这个预测,模型内部必须隐式掌握物体运动规律、遮挡关系、物理常识,这些正是驾驶决策需要的场景理解力。

和传统链路的区别:传统自动驾驶是感知、预测、规划的分立模块,每个模块人工设计特征和规则,长尾场景(异形车、罕见交互)覆盖靠工程师逐个补丁。世界模型的路线是把场景理解统一到生成框架里:预测未来时自然知道哪些区域不确定、哪些行为有风险,天然带后果推演能力,长尾场景由数据驱动泛化。

和语言模型的区别:输出是连续的时空视频而不是离散 token,评价「预测得好不好」没有像语言那样的下一个词准确率,物理一致性(物体不能凭空消失、轨迹不能违反动力学)是隐式约束。

落地的三个难点。可控性:生成未来时要把自车候选动作作为条件注入,比较不同动作下的未来,这要求条件控制精确。实时性:视频生成模型的推理速度离车规级实时要求还远,当前更多用于训练和仿真而不是在线决策。评测:没有公认的世界模型基准,各家自说自话,场景覆盖度和物理合理性难量化。

面试官会怎么追问

  • 「世界模型现在实际用在哪?」 两个成熟点:数据生成,生成罕见危险场景的仿真数据补训练集,比路采便宜且可标注;闭环仿真,用世界模型做环境模拟器,规控策略在仿真里验证再上车。在线实时规划还在早期。
  • 「怎么把动作条件注入?」 动作作为控制信号加在生成过程里,类似视频生成里的运动控制。训练数据天然带「画面加自车动作序列」的配对,模型学到动作和画面变化的对应。
  • 「物理一致性怎么保证?」 部分靠数据(真实视频自然满足物理)、部分靠约束(训练目标加几何一致性损失)、评测用物理合理性指标(物体 permanence、轨迹平滑度)监控。

回答的坑

  • 把世界模型说成营销词。要能讲清「预测下一帧等于理解世界」这个技术逻辑。
  • 宣称它取代现有自动驾驶栈。当前定位是训练和仿真基础设施,在线规划是远期方向。
—— 本题完 ——