EVAL · ALL
评测与可观测 · 全部题目
共 101 篇,本页第 97-101 篇。← 回到学习路径视图
No.995幻觉问题:大模型「胡说八道「的原因?有哪些缓解策略面试官想看你能否系统性拆解幻觉的成因(而非只背“训练数据问题”),并给出多维度、可落地的缓解策略。这是典型的“系统设计+…→No.996评估方法论:如何科学评估大模型性能?评估数据集怎么构造才靠谱面试官想看你是否具备系统性的评估思维,而非只会跑几个 benchmark。这题是“系统设计+工程取舍”型,刁钻点在于:评…→No.997为什么传统的 NLP 评估指标(如 BLEU, ROUGE)对于评估现代 LLM 的生成质量来说,存在很大的局限性面试官想看的不是你会不会背 BLEU/ROUGE 公式,而是你能否精准指出指标与任务之间的“语义鸿沟”。这属于工程取舍 …→No.998什么是「LLM-as-a-Judge「?使用 LLM 来评估另一个 LLM 的输出,有哪些优点和潜在的偏见面试官想考察你对 LLM 评估体系的深度理解,而非简单背诵概念。这是典型的“系统设计+工程取舍”型问题,刁钻点在于:你是…→No.999你了解哪些专门用于评估 Agent 能力的基准测试?这些基准通常如何构建测试环境和任务面试官想看你是否真正理解Agent评估的“工程陷阱”——不是背几个基准名字,而是能拆解其设计哲学:任务环境如何模拟真实不…→