如何评估 Agent 的「长程规划「能力
配图(无描述)
1️⃣ 考察意图
考察对长程任务评估的理解。刁钻点:长程规划的评估不能只看最终结果,还要看"规划质量"和"动态调整"。
2️⃣ 标准答
长程规划评估三维度:
- 任务完成率:100+步任务是否最终完成。这是基础指标但不够——可能用150步完成了50步就能完成的任务
- 规划效率:实际步数/最优步数。如最优5步、Agent用了15步,效率=33%。用A*算法或人工标注最优路径
- 动态调整能力:某步失败后是否调整计划。指标:错误后恢复率(失败后是否在3步内回到正确路径)
评估方法:
- ALFWorld:文本世界的长程任务("把苹果放到冰箱里"需要:找苹果→拿起→走到冰箱→打开冰箱→放入→关闭)。评估完成率和步数
- PlanBench:专门评估规划能力。给定初始状态和目标,检查Agent的规划是否正确且最优
- 自定义长程任务:如"管理一周日程"需要50+步交互。用LLM-as-Judge评估规划合理性
长程规划的特殊挑战:
- 上下文遗忘:50步后忘记第1步的目标。评估:在第30步问"你的最终目标是什么"
- 错误累积:第5步的微小错误在第30步放大成大错误。评估:逐步trace检查错误传播
- 策略僵化:Agent固守初始计划,不根据环境反馈调整。评估:故意改变环境(如"冰箱坏了"),看Agent是否调整计划
3️⃣ 答题模板
"三维度:任务完成率(基础)、规划效率(实际步数/最优步数)、动态调整能力(错误后3步内恢复)。评估方法:ALFWorld(文本世界)、PlanBench(规划专项)、自定义长程任务+LLM-as-Judge。特殊挑战:上下文遗忘(第30步问目标)、错误累积(逐步trace)、策略僵化(故意改环境测试调整)。"
4️⃣ 高频追问
追问 1:怎么找"最优步数"?
两种方式:(1) 人工标注——让专家手动完成任务,记录步数作为最优。成本高但准确;(2) 算法求解——对结构化环境(如ALFWorld),用A*或BFS搜索最短路径。只适用于状态空间小的任务。对于真实场景(如Web操作),通常用人工标注的"合理步数"作为参考,而非严格最优。
追问 2:Agent上下文遗忘怎么检测和解决?
检测:在对话的第N步插入"请复述你的最终目标"的检查问题,如果Agent无法正确复述→遗忘。解决:(1) 摘要注入——每10步自动生成对话摘要并注入上下文,提醒Agent目标;(2) 外部记忆——将目标存储在外部(如todo list工具),Agent每步检查todo list;(3) 上下文压缩——用LLM压缩历史对话(200步→500 token摘要),保留关键信息。
5️⃣ 避坑
- ❌ "完成任务就行,步数不重要" → ✅ "长程任务中步数很重要——50步完成5步的任务意味着效率极低,且更多步数=更多出错机会+更高成本。"
6️⃣ 简历呼应
- 有Agent规划经验:从"长程规划评估"切入
- 校招无项目:在ALFWorld上测试GPT-4的长程规划能力
- "ALFWorld: Aligning Text and Embodied Environments" (Shridhar et al., 2021) / "PlanBench: Evaluating LLM Planning Capabilities" (Valmeekam et al., 2023)
—— 本场面试完 ——