EVAL · ALL
评测与可观测 · 全部题目
共 101 篇,本页第 1-48 篇。← 回到学习路径视图
No.1000在评估一个 Agent 的任务完成情况时,除了最终结果的正确性,还有哪些过程指标是值得关注的?(例如:效率、成本、鲁棒性)面试官想看你能否跳出“结果正确率”的单一维度,从工程落地角度系统评估 Agent。这属于系统设计+工程取舍型问题,刁钻点…→No.1001在进行人工评估时,如何设计合理的评估准则和流程,以保证评估结果的客观性和一致性面试官想看你是否真正理解“人工评估”不是拍脑袋打分,而是一个可量化的工程流程。考察类型是系统设计 + 工程取舍。刁钻点在…→No.1002VLM 在生成内容时,同样会遇到“幻觉”(Hallucination)问题,但它的表现形式和纯文本 LLM 有何不同?请举例说明面试官想考察你是否真正理解多模态幻觉的独特性,而非简单复述LLM幻觉概念。这是概念对比+工程取舍类型题,刁钻点在于:VL…→No.1006什么是“LLM-as-a-Judge”?使用 LLM 来评估另一个 LLM 的输出,有哪些优点和潜在的偏见面试官想考察你对 LLM 评估前沿方法的理解深度,而非仅仅背诵定义。这属于“系统设计+工程取舍”类问题,刁钻点在于:你是…→No.1010你说混合检索把召回率从 0.72 提到了 0.89,这个数字怎么来的面试官真正想看的是:你是否具备科学评估的工程化思维,而不是只会背概念或拍数字。这道题是典型的“debug + 系统设计”…→No.1011测试集怎么构建的?ground truth 谁标注的?如果标注有错怎么办面试官想考察你构建评估体系时的工程严谨性和质量控制意识。这不是背概念题,而是系统设计 + debug 类型。刁钻点在于:…→No.1012200条够吗?覆盖了所有 query 类型吗?生成阶段的答案质量怎么评估?也是你自己看的?有没有用自动化评估工具面试官在考察你对 RAG 系统评估的工程化思维,而非单纯背概念。核心看三点:一是测试集规模与覆盖度的 trade-off…→No.1013如果 Agent 产生了错误记忆(例如:误解用户、错误事实、幻觉写入),你如何让系统自动纠正或“遗忘”错误记忆面试官想看你是否理解Agent记忆系统在真实部署中的脆弱性——错误记忆一旦写入,会像“脏数据”一样污染后续所有推理。这属…→No.1015LoCoMo基准如何评估长对话场景下的记忆能力面试官想看你是否理解“长对话记忆评估”不是简单堆长文本,而是需要对抗“遗忘曲线”和“信息干扰”的系统设计。考察类型是系统…→No.1016可信记忆(Trustworthy Memory)涉及哪些维度?隐私保护、可解释性、幻觉鲁棒性如何解决面试官想考察你对 Agent 记忆系统在“可信”维度上的系统性理解,而非零散知识点。这是一道系统设计 + 工程取舍题,刁…→No.1017你们的模型基于哪些异构图像做增强?模型会不会产生幻觉,生成文档外的内容面试官想考察你两个核心能力:多模态数据增强的工程实践和幻觉控制的系统性思维。这不是背概念题,而是系统设计 + debug…→No.1018若高德 API 要求输入经纬度坐标,但大模型产生幻觉输出错误公司坐标,导致门店查询错误,该怎么干预模型?如果模型坚持认为自己的坐标是对的,该怎么处理?定位到问题原因后,又该怎么解决面试官想考察你在 Agent 系统中处理模型幻觉的工程化能力,而非单纯背概念。核心是:当模型输出与外部 API 硬约束冲…→No.1019如何缓解LLM幻觉面试官真正想看的不是“你知道幻觉是什么”,而是你在工程实践中如何系统性地压制幻觉。这是一道系统设计+工程取舍题,刁钻点在…→No.1021如何证明 Agent 比人工客服更好?设计评估方案面试官想看你是否具备系统性评估思维,而非简单罗列指标。这是一道系统设计+工程取舍题,刁钻点在于:Agent 和人工客服的…→No.1022如何设计一个评估方案来衡量 LLM 的特定能力,比如「事实性/幻觉水平「、「推理能力「或「安全性「面试官想看你是否具备系统化评估设计的硬实力,而非只会跑现成benchmark。考察类型是系统设计+工程取舍,刁钻点在于:…→No.1023评估一个 Agent 为什么比评估一个基础 LLM 更加困难和复杂?评估的维度有哪些不同面试官想看你能否穿透“Agent 就是 LLM + 工具”的表象,理解评估复杂性的本质。这题属于系统设计 + 工程取舍类…→No.1024如何设计一个评估方案来衡量 LLM 的特定能力,比如“事实性/幻觉水平”、“推理能力”或“安全性”面试官想看你能否从“跑个benchmark”的初级思维,升级到“设计一套可复现、有区分度、能指导迭代的评估体系”。这属于…→No.1026但是未来的超级人工智能模型将表现出复杂的行为,对人类来说难以可靠地评估,对于人类对超级人工智能模型进行弱监督,我们研究了这个问题的类比:弱模型监督是否能唤起更强大模型的全部能力面试官想考察你对“弱到强泛化”(Weak-to-Strong Generalization)这一前沿课题的底层理解,而非…→No.1028如何设计 Agent 的评估方案?LLM-as-a-Judge面试官想考察你对 Agent 评估的系统性认知,而非单纯背诵指标。核心看三点:① 是否理解 Agent 评估与 LLM …→No.1029LangSmith vs Langfuse vs OpenTelemetry:LLM 可观测怎么选LangSmith 集成深、Langfuse 开源可私有化、OTel 统一观测标准。这篇给三个可观测方案的对比表与按团队…→No.17阿里 Agent 岗三面:评测体系怎么做,怎么防止裁判被糊弄非确定性输出没法断言精确值:断言性质、多次运行看分布、Golden Set 当基线;LLM 裁判要先校准;最容易被忽略的…→No.18RAGAS vs DeepEval vs TruLens:RAG 评测框架怎么选RAGAS 指标集接入快、DeepEval 测试框架进 CI、TruLens 反馈函数带调用链归因。这篇给三个评测框架的…→No.25第 7 章 · 评测面试导学评测章节的考点地图与刷题路线:Benchmark 与数据污染、Golden Set 与回归、LLM 裁判校准、线上评测与…→No.901列举你知道的 Agent Benchmark,以及它们评估的侧重点。面试官想看你对 Agent 评估生态的广度认知。刁钻点在于:很多人只答"AgentBench"或"HumanEval",…→No.902什么是 AgentBench?它包含哪些环境?各环境的评估特点是什么考察对 AgentBench 的深度理解——不仅知道名字,还要知道8个环境的具体设计和评估特点。…→No.903WebArena 和 Mind2Web 的区别是什么?分别适合评估什么考察对 Web Agent 评估的深度理解。刁钻点:两者都是 Web 评估但设计哲学不同——WebArena 评估"端到…→No.904SWE-bench 是如何评估 Agent 的编程能力的?为什么这么难考察对代码 Agent 评估的深度理解。刁钻点:SWE-bench 不是"写代码"评估,而是"修 Bug"评估——需要理…→No.905如何构建一个针对特定业务场景的 Agent 评估集考察从 0 到 1 构建评估集的能力。刁钻点:不是收集数据就行,需要考虑覆盖度、难度分级、防泄漏、可维护性。…→No.906评估 Agent 时,如何区分「模型能力「和「工程实现「的问题考察对 Agent 系统的分解能力。刁钻点:Agent 失败可能不是 LLM 的问题,而是 prompt 设计、工具实现…→No.907Agent 评估中的「数据泄漏「问题如何应对考察对评估公正性的理解。刁钻点:LLM 的训练数据可能包含 benchmark 答案,导致评估分数虚高。…→No.908Agent 评估的未来方向是什么考察技术视野。没有标准答案,但需要展示对评估方法演进的前瞻思考。…→No.909如何评估一个 Agent 的能力?有哪些常用指标面试官想看你能否从任务完成、效率、安全三个维度构建完整的评估指标体系。刁钻点:很多人只答"准确率",但 Agent 评估…→No.910Agent 评估与 LLM 评估有什么不同考察对两种评估范式的区分能力。刁钻点:Agent评估不是LLM评估的简单扩展——需要评估"行为序列"而非"单次输出"。…→No.911什么是 LLM-as-a-Judge?它的优缺点是什么考察对LLM评估方法的深度理解。刁钻点:需要说出LLM-as-Judge的具体偏见和缓解方案。…→No.912如何评估 Agent 的「工具调用「能力考察对工具调用评估的系统性理解。刁钻点:工具调用不只是"选对工具",还包括"参数正确"、"结果解析正确"、"错误处理"。…→No.913如何评估 Agent 的「长程规划「能力考察对长程任务评估的理解。刁钻点:长程规划的评估不能只看最终结果,还要看"规划质量"和"动态调整"。…→No.914Agent 的「安全性「如何评估考察安全评估的系统性设计。刁钻点:安全评估需要"红队思维"——主动构造攻击场景。…→No.915如何设计一个 Agent 的 A/B 测试实验考察实验设计能力。刁钻点:Agent A/B测试比传统Web A/B复杂——需要控制"环境状态"和"多步交互"的变量。…→No.916Agent 评估中「人类在环「(Human-in-the-Loop)的作用是什么考察对HITL在评估中作用的理解。刁钻点:HITL不仅是"人工标注",还包括"人工审计"、"人工干预"、"人工校准"。…→No.933auc指标解释一下面试官想看你是否真正理解AUC的统计意义,而非仅背定义。考察类型是概念+工程取舍:刁钻点在于你是否知道AUC等价于Wil…→No.934BLEU指标讲一下面试官想确认你是否真正理解BLEU这个“老牌”指标,而不仅仅是背公式。考察类型是背概念+工程取舍。刁钻点在于:很多人只记…→No.935什么是幻觉(Hallucination)面试官想确认你是否真正理解“幻觉”在 LLM 语境下的精确含义,而非停留在“胡说八道”的模糊印象。考察类型为概念辨析 +…→No.936什么是大模型幻觉面试官想看你是否真正理解“幻觉”的本质,而非只会背定义。考察类型是概念+工程取舍。刁钻点在于:很多人只把幻觉当成“模型说…→No.937为什么需要解决LLM的幻觉问题面试官想考察你是否能从“工程落地”而非“学术定义”的角度理解幻觉问题。这不是让你背“幻觉是生成与事实不一致的内容”这种教…→No.938BLEU(2002,机器翻译):** 计算模型输出和参考答案的 n-gram 重叠率,精确率视角——「我说的有多少是对的面试官想确认你是否真正理解 BLEU 的“精确率 + 惩罚”设计哲学,而不仅仅是背公式。核心考察点:① 能否清晰解释 n…→No.939ROUGE(2004,文本摘要):** 计算参考答案在模型输出里的覆盖率,召回率视角——「参考答案有多少被我覆盖了面试官想确认你是否真正理解 ROUGE 作为召回率导向指标的工程本质,而不仅仅是背出“ROUGE-N/ROUGE-L”这…→No.940**Q:BLEU 分高的翻译一定更好吗面试官想看的不是你会不会背BLEU公式,而是你对“自动评估指标”的批判性思维和工程落地感。这道题是典型的“概念+工程取舍…→No.942如何评估多模态模型的性能?除了准确率,还有哪些指标?(如 Recall@K, mAP 等)面试官想看你是否具备“多模态评估体系”的全局视野,而非仅停留在分类准确率。核心考察点:① 能否区分不同任务(检索、生成、…→