先这样答
我会按任务、质量、资源三层设计 LLM 评测指标体系,并为每项指标建立 baseline。没有 baseline,单看指标数值很难判断结果好坏。
任务层看任务成功率和步骤效率,回答系统能不能完成目标、完成过程是否高效。质量层看相关性、事实性和安全性,判断回答是否切题、是否符合事实、是否存在安全问题。资源层看延迟和成本,衡量完成任务所需的响应时间和资源开销。三层分别回答“能否完成”“完成得怎样”“付出多少资源”。
评测方法要结合指标类型。规则能直接判定的内容用自动指标,例如任务是否成功。相关性、事实性这类语义问题用 LLM-as-Judge。再通过人工抽检校准裁判,检查自动判断是否可靠。最后将各项指标与 baseline 对比,观察任务、质量和资源表现的变化,不用单一指标替代整体判断。
面试官会怎么追问
-
「为什么要把指标分成这三层?」 任务层关注目标是否完成,以及步骤效率。质量层关注回答本身是否相关、真实和安全。资源层补充延迟与成本,避免只看回答质量而忽略完成任务的资源开销。
-
「哪些指标适合自动评测,哪些要交给 LLM-as-Judge?」 规则可以明确判定的指标适合自动评测。涉及相关性、事实性等语义判断的指标,可以用 LLM-as-Judge。两种方法都要配合人工抽检,校准裁判的判断。
-
「有了指标数值,怎么判断评测结果好不好?」 先看每项指标对应的 baseline,再比较当前结果与 baseline。任务成功率、步骤效率、质量和资源表现都要分别比较。只报告一个绝对数值,不能说明系统表现是否改善。
回答的坑
- 只谈任务成功率,会漏掉回答质量以及延迟、成本。
- 只依赖自动指标或 LLM-as-Judge,不做人工抽检,无法校准裁判。
同系列的题
这家公司的面经实录
—— 本题完 ——