Q916评测与可观测真题解析评测AgentAlpha 社区真题库约 4 分钟更新 2026-09-29

Agent 评估中「人类在环「(Human-in-the-Loop)的作用是什么

Agent 评估中「人类在环「(Human-in-the-Loop)的作用是什么

1️⃣ 考察意图

考察对HITL在评估中作用的理解。刁钻点:HITL不仅是"人工标注",还包括"人工审计"、"人工干预"、"人工校准"。

2️⃣ 标准答

HITL在Agent评估中的四个作用:

  1. 人工标注(Ground Truth):为评估集标注expected behavior。自动化标注不可靠的场景(如开放式对话)必须人工标注
  2. LLM-as-Judge校准:抽20%数据人工评分,计算与GPT-4评分的Kappa。<0.7则调整Judge prompt
  3. 安全审计:对Agent的"边界行为"(如拒绝操作、错误恢复)人工审核,判断行为是否合理
  4. 用户体验评估:人工评估Agent的交互体验——"回答是否自然"、"是否理解用户意图"、"是否给了多余信息"

HITL的成本与效率:

  • 人工标注:0.5-2/条,1000条约500-2000
  • 人工审计:50/小时,100条约2小时=100
  • 人工校准:50/小时,100条约3小时=150

HITL的优先级:

  • 安全评估:100%人工审核(不可自动化)
  • 开放式输出:20%人工抽检(LLM-as-Judge初筛+人工校准)
  • 结构化输出:5%人工抽检(自动化匹配为主)
  • 用户体验:定性研究(5-10个用户深度访谈)

3️⃣ 答题模板

"HITL四个作用:人工标注(Ground Truth,$0.5-2/条)、LLM校准(20%抽检,Kappa>0.7)、安全审计(100%人工)、用户体验评估(定性研究5-10人)。优先级:安全100%人工、开放式20%抽检、结构化5%抽检、UX定性。核心:HITL不是'替代自动化'而是'校准+补充'。"

4️⃣ 高频追问

追问 1:怎么降低人工标注成本?

三个方案:(1) 主动学习——只用人工标注LLM-as-Judge不确定的样本(置信度<0.7的),可以减少50%的标注量;(2) 众包标注——用Amazon MTurk等平台,成本降到$0.1-0.3/条,但质量需要交叉验证(3人标注取多数);(3) 半自动标注——LLM生成候选标注,人工审核修改,效率提升3-5倍。

追问 2:用户体验评估怎么做?

混合方法:(1) 定量——在线指标(完成率、满意度评分、NPS、留存率);(2) 定性——5-10个用户深度访谈(30分钟/人),问"你觉得Agent哪里好用/不好用/有什么建议";(3) 可用性测试——给用户5个任务,观察完成过程,记录"卡在哪里"、"问了什么问题"、"用了几步"。定性研究的5-10个用户足够发现80%的可用性问题(Nielsen法则)。

5️⃣ 避坑

  • ❌ "全自动评估就够了" → ✅ "安全评估必须100%人工。开放式输出需要人工校准。UX需要定性研究。HITL是评估质量保证的最后一道防线。"

6️⃣ 简历呼应

  • 有评估经验:从"HITL评估流程"切入
  • 校招无项目:为简单Agent设计HITL评估方案
  • "Human-in-the-Loop Systems for AI Safety" (Raghu et al., 2023) / "Why You Only Need to Test with Five Users" (Nielsen, 2000)

本章学习完毕 ← 返回 Agent 岗面试宝典 v3 · 精华版 | 📝 建议整理错题笔记 | 🎯 标记掌握程度

—— 本场面试完 ——

我们不做玩具级 Demo 教学。训练营的作业是开源项目和论文——我们想陪伴你,做出能改变生活、最后改变世界的项目。