Q913评测与可观测真题解析评测AgentAlpha 社区真题库约 4 分钟更新 2026-09-29

如何评估 Agent 的「长程规划「能力

如何评估 Agent 的「长程规划「能力

配图(无描述)

1️⃣ 考察意图

考察对长程任务评估的理解。刁钻点:长程规划的评估不能只看最终结果,还要看"规划质量"和"动态调整"。

2️⃣ 标准答

长程规划评估三维度:

  1. 任务完成率:100+步任务是否最终完成。这是基础指标但不够——可能用150步完成了50步就能完成的任务
  2. 规划效率:实际步数/最优步数。如最优5步、Agent用了15步,效率=33%。用A*算法或人工标注最优路径
  3. 动态调整能力:某步失败后是否调整计划。指标:错误后恢复率(失败后是否在3步内回到正确路径)

评估方法:

  • ALFWorld:文本世界的长程任务("把苹果放到冰箱里"需要:找苹果→拿起→走到冰箱→打开冰箱→放入→关闭)。评估完成率和步数
  • PlanBench:专门评估规划能力。给定初始状态和目标,检查Agent的规划是否正确且最优
  • 自定义长程任务:如"管理一周日程"需要50+步交互。用LLM-as-Judge评估规划合理性

长程规划的特殊挑战:

  • 上下文遗忘:50步后忘记第1步的目标。评估:在第30步问"你的最终目标是什么"
  • 错误累积:第5步的微小错误在第30步放大成大错误。评估:逐步trace检查错误传播
  • 策略僵化:Agent固守初始计划,不根据环境反馈调整。评估:故意改变环境(如"冰箱坏了"),看Agent是否调整计划

3️⃣ 答题模板

"三维度:任务完成率(基础)、规划效率(实际步数/最优步数)、动态调整能力(错误后3步内恢复)。评估方法:ALFWorld(文本世界)、PlanBench(规划专项)、自定义长程任务+LLM-as-Judge。特殊挑战:上下文遗忘(第30步问目标)、错误累积(逐步trace)、策略僵化(故意改环境测试调整)。"

4️⃣ 高频追问

追问 1:怎么找"最优步数"?

两种方式:(1) 人工标注——让专家手动完成任务,记录步数作为最优。成本高但准确;(2) 算法求解——对结构化环境(如ALFWorld),用A*或BFS搜索最短路径。只适用于状态空间小的任务。对于真实场景(如Web操作),通常用人工标注的"合理步数"作为参考,而非严格最优。

追问 2:Agent上下文遗忘怎么检测和解决?

检测:在对话的第N步插入"请复述你的最终目标"的检查问题,如果Agent无法正确复述→遗忘。解决:(1) 摘要注入——每10步自动生成对话摘要并注入上下文,提醒Agent目标;(2) 外部记忆——将目标存储在外部(如todo list工具),Agent每步检查todo list;(3) 上下文压缩——用LLM压缩历史对话(200步→500 token摘要),保留关键信息。

5️⃣ 避坑

  • ❌ "完成任务就行,步数不重要" → ✅ "长程任务中步数很重要——50步完成5步的任务意味着效率极低,且更多步数=更多出错机会+更高成本。"

6️⃣ 简历呼应

  • 有Agent规划经验:从"长程规划评估"切入
  • 校招无项目:在ALFWorld上测试GPT-4的长程规划能力
  • "ALFWorld: Aligning Text and Embodied Environments" (Shridhar et al., 2021) / "PlanBench: Evaluating LLM Planning Capabilities" (Valmeekam et al., 2023)

—— 本场面试完 ——

我们不做玩具级 Demo 教学。训练营的作业是开源项目和论文——我们想陪伴你,做出能改变生活、最后改变世界的项目。