Agent 评估中「人类在环「(Human-in-the-Loop)的作用是什么
1️⃣ 考察意图
考察对HITL在评估中作用的理解。刁钻点:HITL不仅是"人工标注",还包括"人工审计"、"人工干预"、"人工校准"。
2️⃣ 标准答
HITL在Agent评估中的四个作用:
- 人工标注(Ground Truth):为评估集标注expected behavior。自动化标注不可靠的场景(如开放式对话)必须人工标注
- LLM-as-Judge校准:抽20%数据人工评分,计算与GPT-4评分的Kappa。<0.7则调整Judge prompt
- 安全审计:对Agent的"边界行为"(如拒绝操作、错误恢复)人工审核,判断行为是否合理
- 用户体验评估:人工评估Agent的交互体验——"回答是否自然"、"是否理解用户意图"、"是否给了多余信息"
HITL的成本与效率:
- 人工标注:0.5-2/条,1000条约500-2000
- 人工审计:50/小时,100条约2小时=100
- 人工校准:50/小时,100条约3小时=150
HITL的优先级:
- 安全评估:100%人工审核(不可自动化)
- 开放式输出:20%人工抽检(LLM-as-Judge初筛+人工校准)
- 结构化输出:5%人工抽检(自动化匹配为主)
- 用户体验:定性研究(5-10个用户深度访谈)
3️⃣ 答题模板
"HITL四个作用:人工标注(Ground Truth,$0.5-2/条)、LLM校准(20%抽检,Kappa>0.7)、安全审计(100%人工)、用户体验评估(定性研究5-10人)。优先级:安全100%人工、开放式20%抽检、结构化5%抽检、UX定性。核心:HITL不是'替代自动化'而是'校准+补充'。"
4️⃣ 高频追问
追问 1:怎么降低人工标注成本?
三个方案:(1) 主动学习——只用人工标注LLM-as-Judge不确定的样本(置信度<0.7的),可以减少50%的标注量;(2) 众包标注——用Amazon MTurk等平台,成本降到$0.1-0.3/条,但质量需要交叉验证(3人标注取多数);(3) 半自动标注——LLM生成候选标注,人工审核修改,效率提升3-5倍。
追问 2:用户体验评估怎么做?
混合方法:(1) 定量——在线指标(完成率、满意度评分、NPS、留存率);(2) 定性——5-10个用户深度访谈(30分钟/人),问"你觉得Agent哪里好用/不好用/有什么建议";(3) 可用性测试——给用户5个任务,观察完成过程,记录"卡在哪里"、"问了什么问题"、"用了几步"。定性研究的5-10个用户足够发现80%的可用性问题(Nielsen法则)。
5️⃣ 避坑
- ❌ "全自动评估就够了" → ✅ "安全评估必须100%人工。开放式输出需要人工校准。UX需要定性研究。HITL是评估质量保证的最后一道防线。"
6️⃣ 简历呼应
- 有评估经验:从"HITL评估流程"切入
- 校招无项目:为简单Agent设计HITL评估方案
- "Human-in-the-Loop Systems for AI Safety" (Raghu et al., 2023) / "Why You Only Need to Test with Five Users" (Nielsen, 2000)
本章学习完毕 ← 返回 Agent 岗面试宝典 v3 · 精华版 | 📝 建议整理错题笔记 | 🎯 标记掌握程度
—— 本场面试完 ——