FINETUNE · ALL
训练与微调 · 全部题目
共 310 篇,本页第 49-96 篇。← 回到学习路径视图
No.1052SFT使用的数据可能和原始模型预训练时的数据分布有较大区别,怎么解决面试官想考察你能否在SFT(监督微调)中解决分布偏移导致的灾难性遗忘和过拟合问题。这属于工程取舍类型,刁钻点在于:候选人…→No.1053SFT和强化学习各自有什么优缺点,分别适用于什么场景面试官想考察你对 LLM 训练范式的底层理解,而非简单背诵概念。这是典型的“工程取舍 + 系统设计”题,刁钻点在于:很多…→No.1054什么场景下用SFT,什么场景下用RL面试官想看你是否真正理解SFT和RL在LLM训练中的本质差异,而非死记硬背“SFT是模仿,RL是偏好”。考察类型是工程取…→No.1055GRPO的KL散度是什么?KL散度中超参数如何设计面试官想考察你是否真正理解GRPO(Group Relative Policy Optimization)中KL散度的设…→No.1056为什么使用强化学习会存在训练不稳定问题?为什么业界还在用面试官想考察你对 RL 在 LLM 对齐中核心问题的理解深度,而非单纯背诵 PPO 流程。刁钻点在于:既要解释“不稳定”…→No.1057交叉熵和KL散度的联系和区别?PPO的KL散度可以改成交叉熵吗?分类任务可以用KL散度吗面试官想看你是否真正理解交叉熵和KL散度的数学本质,而非死记公式。这是典型的“概念辨析+工程迁移”题,刁钻点在于:PPO…→No.1059LLM训练的时候为什么需要warmup面试官想看的不是“warmup是学习率从0慢慢升”这种概念背诵,而是你是否理解warmup在LLM训练中的数学动机和工程…→No.1064PPO的clip机制?在线强化学习和离线强化学习有什么区别?RLHF是哪一种面试官想考察你对强化学习(RL)核心机制的深度理解,而非简单背诵。刁钻点在于:PPO的clip机制看似简单,但需要解释其…→No.1068八股:分布式训练中 Zero-2 和 Zero-3 的核心区别是什么面试官想考察你对分布式训练中显存-通信权衡的深度理解,而非单纯背诵 ZeRO 阶段定义。刁钻点在于:能否清晰区分 ZeR…→No.1070大模型训练中的数据并行、模型并行、流水线并行分别适用于什么场景?ZeRO 是什么面试官想考察你对分布式训练核心范式的理解深度,而非背诵定义。这道题是典型的“概念+工程取舍”混合型,刁钻点在于:多数人只…→No.1071和传统SFT相比,RLHF旨在解决语言模型中的哪些核心问题面试官想看你是否真正理解RLHF的动机,而非仅背诵“人类反馈+PPO”的流程。核心考察类型是工程取舍与系统设计:SFT(…→No.1072易混淆点:LayerNorm和BatchNorm在训练时的梯度计算区别面试官想看你是否真正理解归一化层的数学本质,而非只会调API。这是典型的“背概念+工程取舍”混合题,刁钻点在于:大多数人…→No.1073微调重点:LoRA是什么?原理 & 为什么它能高效微调大模型面试官想考察你是否真正理解LoRA的数学本质,而非只会调包。这是典型的“原理+工程取舍”题,刁钻点在于:很多人能背出“低…→No.1074训练调参:微调 Qwen 时验证集 loss震荡,可能原因有哪些?(学习率?数据噪声?)面试官想考察你微调大模型时的系统调试能力,而非单纯背概念。刁钻点在于:loss震荡是“现象”,背后可能是学习率、数据、b…→No.1075显存优化:训练/推理显存不够?有哪些实用trick?(量化、Offload、FlashAttention…)面试官想考察你对大模型显存瓶颈的系统性理解,而非零散罗列技巧。刁钻点在于:能否区分训练与推理的显存消耗差异(训练吃激活值…→No.1076项目深挖:你提到用DeepSpeed做SFT训练,请讲一下DeepSpeed ZeRO Stage 1-3的区别,以及什么时候用FSDP会更好面试官想确认你是否真正理解分布式训练的内存优化原理,而非只背过“ZeRO分三阶段”的结论。考察类型是工程取舍+系统设计,…→No.1077项目深挖:说下LoRA的原理,LoRA是不是只能在Linear层插?为什么不能插在LayerNorm之后?这会对训练稳定性造成什么影响面试官想考察你对 LoRA 的原理级理解,而非背诵“低秩分解”定义。刁钻点在于:LoRA 的适用性边界——为什么它天然适…→No.1078项目深挖:SFT使用的数据集,使用了多少张卡?SFT训练多久面试官想看你是否真正动手训过模型,而非只背过论文。这道题表面问“多少卡、多久”,实则考察三个层次:资源估算能力(从模型参…→No.1079项目深挖:在项目中你用过 DPO 吗?和 PPO 相比,它有什么优缺点面试官想看你是否真正理解RLHF两种主流方法的底层逻辑和工程取舍,而非背诵“DPO简单、PPO复杂”的结论。考察类型是工…→No.1081你认为高质量的人工合成数据在未来的模型训练中将扮演什么样的角色面试官想看你是否真正理解合成数据在LLM训练中的“双刃剑”本质,而非简单吹捧或贬低。考察类型是工程取舍+系统设计,刁钻点…→No.1082增量预训练的过程当中,loss上升正常吗面试官想考察你对训练动态的底层理解,而非简单背诵“loss下降才正常”。刁钻点在于:增量预训练(Incremental …→No.1083在增量预训练过程中如何设置学习率(learning rate, LR)面试官想考察你对增量预训练(Incremental Pretraining)超参数调优的实战经验,而非背诵理论。核心刁钻…→No.1084DPO的loss是什么这道题考察的是对DPO(Direct Preference Optimization)损失函数的精确数学记忆和推导逻辑,…→No.1085怎么理解DPO的损失函数面试官想看你是否真正吃透DPO(Direct Preference Optimization)的数学直觉,而非仅背诵公式…→No.1086Deepseek中蒸馏R1是什么?是否比从零RL训练更好面试官想考察你对知识蒸馏与强化学习在推理模型训练中的本质差异的理解,而非简单背诵概念。刁钻点在于:DeepSeek-R1…→No.1087DPO 和 PPO 在 Agent 场景下的选择和优劣势是什么?为什么 DPO 更稳定面试官想看你是否真正理解RLHF两种主流方法在Agent场景下的工程取舍,而非死记硬背概念。刁钻点在于:PPO是RLHF…→No.1088和传统SFT相比,RLHF旨在解决语言模型中的哪些核心问题?为什么说SFT本身不足以实现我们期望的“对齐”目标面试官想检验你是否真正理解RLHF的动机,而非仅背诵“SFT+RLHF”流程。核心考察点:SFT作为监督学习的本质缺陷(…→No.1090What is LoRA, and how does it work at a high level面试官想考察你对参数高效微调(PEFT)核心方法的理解深度,而非简单背诵 LoRA 定义。刁钻点在于:你是否能讲清低秩分…→No.1091What is QLoRA, and how does it differ from LoRA面试官想考察你对参数高效微调(PEFT)技术的深度理解,尤其是量化与微调的结合。这不是简单的背概念题,刁钻点在于:你是否…→No.1092When would you use QLoRA instead of standard LoRA面试官想看你是否真正理解参数高效微调(PEFT)的工程取舍,而非仅背诵概念。这道题考察类型是工程取舍分析,刁钻点在于:Q…→No.1093| Q103 | What is QLoRA, and how does it differ from LoRA面试官想考察你对参数高效微调(PEFT)的深度理解,特别是量化与微调的结合。这不是简单的背概念题,刁钻点在于:QLoRA…→No.1095Can you compare full fine-tuning with Parameter-Efficient Fine-Tuning (PEFT) methods面试官想考察你对大模型微调底层原理的掌握深度,而非简单背诵概念。这是一道工程取舍题,刁钻点在于:你是否能跳出“全量微调效…→No.1096Explain Low-Rank Adaptation (LoRA). How does it work, and what are its key hyperparameters面试官想考察你对参数高效微调(PEFT)核心技术的理解深度,而非仅仅背诵LoRA的定义。刁钻点在于:你是否能说清低秩假设…→No.1097When should you use preference alignment methods instead of supervised fine-tuning (SFT)面试官想考察你对 LLM 训练管线中两个核心阶段——SFT 和偏好对齐——的边界判断能力,而非单纯背诵概念。刁钻点在于:…→No.1098What is Direct Preference Optimization (DPO), and how does it differ from RLHF面试官想看你是否真正理解偏好对齐(Preference Alignment)的底层逻辑,而非只会背论文标题。考察类型是工…→No.1099What is “reward hacking” in RLHF and how does it impact preference tuning面试官想看你是否真正理解RLHF的“奖励过拟合”陷阱,而非只背流程。考察类型是工程取舍+debug:刁钻点在于,候选人常…→No.1100What kind of data is needed for training the Reward Model in RLHF面试官想看你是否真正理解RLHF中Reward Model(RM)训练数据的本质,而非仅背诵“需要偏好数据”的皮毛。考察…→No.1101Why is Proximal Policy Optimization (PPO) often used in the RL fine-tuning stage of RLHF面试官想考察你对RLHF训练流程的底层理解,而非单纯背诵PPO公式。核心是:为什么在RLHF中,PPO比REINFORC…→No.1102What are some challenges or limitations of RLHF面试官想看你是否真正动手调过RLHF,而非只背了“PPO+奖励模型”的流程。这道题属于工程取舍+debug类型,刁钻点在…→No.1103How do you evaluate the success of an RLHF-trained model面试官想看你是否真正理解RLHF评估的“多维性”和“陷阱”,而非只会背MT-Bench或win rate。考察类型是系统…→No.1104Embedding 微调的训练数据怎么来的面试官想考察你从零到一构建高质量微调数据的工程实操能力,而非背诵理论。刁钻点在于:Embedding 微调(如 Sent…→No.1105数据集的复杂度决定了模型的能力上限。你的训练数据是小学数学题,你期待模型解研究生论文面试官想考察你对“数据复杂度与模型能力上限”这一核心认知的深度,而非简单背诵“数据重要”。这是系统设计 + 工程取舍型问…→No.1106Function Call 训练数据怎么构建面试官想考察你对 LLM 训练数据构建的工程化理解,而非背诵论文。刁钻点在于:Function Call 数据不是简单“…→No.1107Function Call 的训练数据怎么构建面试官想考察你对 LLM 工具调用能力的数据驱动理解,而非单纯背诵 API 格式。这是系统设计 + 工程取舍型问题,刁钻…→No.1114. LoRA 微调的原理是什么?秩 r 的选择会对模型表现产生什么影响面试官想考察你对参数高效微调(PEFT)核心技术的底层理解,而非简单背诵“低秩分解”定义。刁钻点在于:区分“知道 LoR…→No.1116Can you describe the typical three stages of the RLHF process?**面试官想确认你是否真正理解RLHF的工程本质,而非仅背诵“SFT→RM→PPO”的流程。考察类型是系统设计+工程取舍,刁…→No.1117LoRA 的参数量计算面试官想验证你是否真正理解LoRA的数学本质,而非只会调包。考察类型是工程取舍+计算推导。刁钻点在于:多数人背下“参数量…→No.1121Q15:你对SFT的理解是什么?与预训练相比有什么差异面试官想验证你是否真正理解SFT在LLM训练管线中的定位,而非仅背诵“微调”定义。考察类型是概念对比+工程取舍。刁钻点在…→