多模态 Agent 中的「世界模型「概念与纯文本 Agent 有何不同
1️⃣ 考察意图
面试官想看你能否从"具身智能"角度理解多模态 Agent 的"世界模型"。刁钻点在于:"世界模型"是 2024-2025 年的热词(Sora、Genie 等),很多人只知道概念但说不清它在 Agent 中的具体作用。
2️⃣ 标准答
世界模型(World Model)是 Agent 对环境物理规律的内部表征,用于预测"如果我做动作 A,环境会变成什么样"。
纯文本 Agent 的"世界模型":
- 纯文本 Agent 的"世界"是文本空间——动作是生成文本,环境变化是文本状态更新
- "世界模型"是 LLM 的语言先验——LLM 知道"如果我说'打开灯',下一轮对话中灯应该是打开的"
- 局限:纯文本无法感知物理世界的视觉/空间信息
多模态 Agent 的"世界模型":
- 多模态 Agent 的"世界"是物理空间——动作是工具调用(移动机器人、抓取物体),环境变化是视觉+空间变化
- 需要三维度理解:(1) 空间理解——"杯子在桌子左边";(2) 物理因果——"推杯子会掉下桌子";(3) 时间预测——"5 秒后杯子会落地"
- 技术实现:(1) 3D 场景表示(NeRF/3D Gaussian Splatting);(2) 物理引擎模拟(MuJoCo/Isaac Sim);(3) 视频预测模型(Sora/Genie)
核心区别总结:
| 维度 | 纯文本 Agent | 多模态 Agent |
|---|---|---|
| 世界表示 | 文本状态 | 3D视觉+空间+物理 |
| 动作空间 | 生成文本 | 秥体操作+工具调用 |
| 预测能力 | 语言推理 | 物理因果+视觉预测 |
| 评估方式 | 文本匹配 | 仿真环境+真实世界 |
| 代表系统 | AutoGPT | RT-2/Genie/Pi |
3️⃣ 答题模板(30 秒电梯版)
"纯文本 Agent 的世界模型是'语言先验'——知道'说打开灯灯就开了'。多模态 Agent 的世界模型需要三维度:空间理解(杯子在左边)、物理因果(推会掉)、时间预测(5秒后落地)。技术实现用 3D 场景表示(NeRF)+物理引擎(MuJoCo)+视频预测(Sora)。核心区别:纯文本是'语言世界',多模态是'物理世界'。"
4️⃣ 高频追问
追问 1:Sora 是世界模型吗?
Sora 是"视频预测模型",有世界模型的特征(能预测物理运动如重力、碰撞),但不是完整的 Agent 世界模型。原因:(1) Sora 不能做条件控制——无法指定"把杯子移到左边"的动作;(2) Sora 没有动作空间——只预测视频不执行动作;(3) Sora 的物理理解不精确——长视频中物理规律会崩溃。完整的 Agent 世界模型需要:视觉预测 + 动作条件 + 物理精确性。Google 的 Genie 更接近——可以条件控制生成。
追问 2:具身 Agent(如机器人)的世界模型怎么训练?
两种方案:(1) 仿真训练——在 Isaac Sim/MuJoCo 中模拟物理世界,Agent 在仿真中学习世界模型。优势:数据无限、安全;劣势:Sim-to-Real Gap。(2) 真实数据训练——用机器人真实操作数据训练世界模型。Google RT-2 用 130K 真实机器人轨迹训练。优势:无 Sim-to-Real Gap;劣势:数据稀缺、成本高。混合方案:仿真预训练+真实数据微调。
追问 3:多模态 Agent 的世界模型和 LLM 的"心智模型"(Theory of Mind)有什么关系?
世界模型是"物理层面"的预测——"推杯子会掉"。心智模型是"社交层面"的预测——"如果我说X,用户会怎么想"。多模态 Agent 需要两者:(1) 物理世界模型——操作环境时预测物理变化;(2) 社交心智模型——与用户交互时预测用户反应。例如服务机器人需要"端咖啡不能洒"(物理世界模型)+"客人喜欢什么口味"(心智模型)。
5️⃣ 避坑
- ❌ "世界模型就是能生成视频的模型" → ✅ "视频生成只是世界模型的'预测'能力。完整世界模型还需要'动作条件'(给定动作预测结果)和'物理精确性'(遵守物理规律)。"
6️⃣ 简历呼应
- 有具身智能项目:从"仿真环境训练"切入,描述你在 Isaac Sim 中训练的世界模型
- 校招无项目:复现 Genie 的条件视频生成,分析物理规律的准确性
- "World Models" (Ha & Schmidhuber, 2018) / "Sora: Creating Video from Text" (OpenAI, 2024) / "Genie: Generative Interactive Environments" (Google, 2024)