多模态 Agent 在自动驾驶中的应用场景有哪些
1️⃣ 考察意图
考察多模态 Agent 在垂直领域的应用理解。刁钻点:自动驾驶的延迟要求和安全要求远高于通用 Agent。
2️⃣ 标准答
三大应用场景:
- 场景理解与推理:VLM 理解驾驶场景("前方有行人横穿"+"正在下雨路滑"+"限速40")→ 推理"需要减速到30并准备刹车"
- 自然语言交互:驾驶员说"找最近的充电站"→ Agent 理解语音+地图视觉 → 导航
- 驾驶决策解释:自动驾驶系统做决策后,VLM 生成人类可理解的解释("我减速是因为前方有学校区域")
技术挑战:
- 延迟要求:感知到决策 <100ms(通用 VLM 500ms+)。解法:轻量 VLM(MobileLLaVA)+ 边缘计算
- 安全等级:ASIL-D(最高安全等级)。VLM 是概率模型无法满足确定性要求。解法:VLM 做辅助决策,规则系统做最终决策
- 多传感器融合:摄像头+激光雷达+毫米波雷达。解法:BEV(Bird's Eye View)融合多传感器为统一表征
代表系统:
- Tesla FSD V12:端到端神经网络(视觉→决策),无显式规则
- Waymo:传统感知+规划+VLM 辅助解释
- 华为 ADS:多传感器融合+VLM 场景理解
3️⃣ 答题模板
"三个场景:场景理解推理(VLM理解行人+天气+限速→减速决策)、自然语言交互(语音+地图→导航)、决策解释(生成人类可理解的解释)。挑战:延迟<100ms(用轻量VLM)、安全ASIL-D(VLM辅助不主导)、多传感器融合(BEV统一表征)。代表:Tesla端到端、Waymo传统+VLM、华为多传感器。"
4️⃣ 高频追问
追问 1:VLM 能做自动驾驶的最终决策吗?
目前不能。原因:(1) 概率性——VLM 输出有不确定性,同一场景可能输出不同决策,不满足 ASIL-D 确定性要求;(2) 延迟——VLM 推理 500ms,自动驾驶需要 <100ms;(3) 可验证性——VLM 的决策无法形式化验证。当前方案:VLM 做场景理解和辅助建议,规则系统或轻量模型做最终决策。未来:随着 VLM 延迟降低和可验证性提升,可能逐步承担更多决策。
追问 2:Tesla FSD V12 的端到端和 VLM 有什么关系?
Tesla FSD V12 用端到端神经网络(视觉输入→ steering/brake 输出),不使用 LLM/VLM。但 Tesla 正在开发基于 LLM 的驾驶助手(语音交互+场景解释)。区别:FSD V12 的网络是专用的小模型(低延迟<50ms),VLM 是通用大模型(高延迟500ms)。两者互补:FSD 做驾驶决策,VLM 做人机交互。
5️⃣ 避坑
- ❌ "VLM 可以替代传统自动驾驶系统" → ✅ "VLM 延迟和确定性不满足安全要求。当前只能做辅助(场景理解+交互+解释),最终决策由规则系统或专用模型做。"
6️⃣ 简历呼应
- 有自动驾驶项目:从"VLM 辅助驾驶决策"切入,描述 VLM 在场景理解中的应用
- 校招无项目:用 LLaVA 分析驾驶场景图片,生成驾驶建议
- "DriveGPT4: Interpretable End-to-end Autonomous Driving via Large Language Model" (Xu et al., 2023) / "LMDrive: Closed-Loop End-to-End Driving with Large Language Models" (Shao et al., 2024)
—— 本场面试完 ——