FINETUNE · ALL
训练与微调 · 全部题目
共 310 篇,本页第 97-144 篇。← 回到学习路径视图
No.1122Q15:大模型训练中常用的优化器有哪些?AdamW 和 Adam 的区别是什么面试官想验证你对优化器原理的“真懂”而非“背概念”。表面是列举优化器,核心是考察:你是否理解 AdamW 为何成为大模型…→No.1123Q19:LoRA微调的原理是什么?秩 r 的选择会对模型表现产生什么影响面试官想验证你是否真正理解LoRA的数学本质,而非仅停留在“低秩分解”的背诵层面。考察类型是工程取舍+原理推导,刁钻点在…→No.1124Q28:bf16 和 float16 的区别?各占多少位?训练中如何选择面试官想确认你是否真正理解混合精度训练中的数值格式取舍,而非死记硬背位宽。核心考察点:数值精度 vs 动态范围的工程权衡…→No.1125Q80: 为什么需要增量预训练?**面试官想考察你是否真正理解“增量预训练”在 LLM 生命周期中的定位,而非仅仅背诵概念。这是典型的概念辨析 + 工程取舍…→No.1126Q83: 什么是warmup ratio?训练过程中怎么设置?**这道题看似基础,实则考察对深度学习训练稳定性的底层理解。面试官想确认你是否只是背过“warmup ratio=0.03”…→No.1127Q97: 为什么需要混合精度训练?**面试官想看你是否真正理解大模型训练中的“内存-速度-精度”三角博弈。这题看似基础,但刁钻点在于:很多人只会背“FP16快…→No.1130What is RLHF, and why is it used for fine-tuning Large Language Models?**面试官想确认你是否真正理解RLHF的动机和工程本质,而非仅仅背诵“人类反馈+强化学习”的套话。考察类型是概念+工程取舍,…→No.1132❓ **Q:LoRA 的 r 怎么选?**面试官想考察你对 LoRA 超参数调优的工程直觉,而非死记硬背“r=8 或 16”。刁钻点在于:r 的选择本质是模型容量…→No.1133❓ **Q:SFT 训练多少个 epoch 合适?**面试官想看你是否真正动手调过 SFT,而不是只背了“1-3 epoch”的结论。核心考察三点:过拟合与泛化的工程权衡、数…→No.1145**MoE如何解决训练稳定性问题?**面试官想考察你对MoE(混合专家模型)训练中特有稳定性问题的深度理解,而非简单背诵概念。这是典型的工程实践+系统设计题,…→No.1152.微调时的训练数据是怎么构建的?如何保证样本多样性和质量面试官想看的不是“数据从哪来”这种表面答案,而是你能否在工程约束下,系统性地构建一个高质量、高多样性的微调数据集。考察类…→No.11573.简要介绍一下 SFT 的核心流程,以及数据集的构建策略, SFT 之后常见的 Post - Training 还有哪些?它们之间的目的有何区别面试官想看你是否真正理解LLM训练全流程的“为什么”,而非只背SFT步骤。考察类型是系统设计+工程取舍:SFT是监督学习…→No.1162.训练 LoRA 模型时,你是如何选择冻结层的?依据是什么面试官想看你是否真正理解LoRA的参数效率本质,而非死记硬背“只调Q、V矩阵”的教条。考察类型是工程取舍+系统设计。刁钻…→No.1163BERT训练时使用的学习率 warm-up 策略是怎样的?为什么要这么做?**面试官想考察你对深度学习训练中“学习率调度”的底层理解,而非单纯背诵BERT配置。这属于工程取舍+debug类型:你是否…→No.1170Explain Low-Rank Adaptation (LoRA). How does it work, and what are its key hyperparameters?**面试官想考察你对参数高效微调(PEFT)核心技术的理解深度,而非仅仅背诵LoRA的定义。刁钻点在于:你是否能说清低秩假设…→No.1175How do you evaluate the success of an RLHF-trained model?**面试官想看你是否真正理解RLHF评估的“多维性”和“陷阱”,而非只会背MT-Bench或win rate。考察类型是系统…→No.1176LoRA 效果不好怎么办?改进方向面试官想看你是否真正理解LoRA的数学本质和工程边界,而非只会调包。考察类型是工程取舍+debug。刁钻点在于:候选人常…→No.1181Q107: Deepseek中蒸馏R1是什么?是否比从零RL训练更好?**面试官想考察你对知识蒸馏与强化学习在推理模型训练中的本质差异的理解,而非简单背诵概念。刁钻点在于:DeepSeek-R1…→No.1182Q14:SFT 的 loss 如何只计算回答部分?(如何 ignore padding token?)面试官真正想看的不是你会不会调 `CrossEntropyLoss(ignore_index=-100)`,而是你是否理…→No.1183Q15: 训练 LoRA 模型时,你是如何选择冻结层的?依据是什么?**面试官想考察你是否真正理解LoRA的底层机制,而非只会调库。这道题是典型的“工程取舍+debug”型问题,刁钻点在于:很…→No.1186Q18:SFT+DPO训练怎么组织这部分数据的?是自己构造还是用公开数据面试官想看你是否真正理解SFT和DPO两阶段训练的数据本质差异,而不仅仅是背流程。核心考察点:SFT数据是“模仿正确答案…→No.1187Q19:SFT 的数据集是越大越好吗?会存在scaling law 吗面试官想看你是否理解SFT(监督微调)与预训练在数据规模上的本质差异,以及能否辩证看待“Scaling Law”的适用范…→No.1188Q1:和传统SFT相比,RLHF旨在解决语言模型中的哪些核心问题?为什么说SFT本身不足以实现我们期望的「对齐「目标面试官想考察你是否真正理解“对齐”的工程本质,而非背诵RLHF流程。核心是:SFT为什么不够?RLHF解决了SFT的哪些…→No.1189Q20:SFT使用的数据可能和原始模型预训练时的数据分布有较大区别,怎么解决面试官想考察你能否在SFT(监督微调)中解决分布偏移导致的灾难性遗忘和过拟合问题。这属于工程取舍类型,刁钻点在于:候选人…→No.1190Q21:SFT和强化学习各自有什么优缺点,分别适用于什么场景面试官想考察你对 LLM 训练范式的底层理解,而非简单背诵概念。这是典型的“工程取舍 + 系统设计”题,刁钻点在于:很多…→No.1192Q22:什么场景下用SFT,什么场景下用RL面试官想看你是否真正理解SFT和RL在LLM训练中的本质差异,而非死记硬背“SFT是模仿,RL是偏好”。考察类型是工程取…→No.1193Q27:GRPO的KL散度是什么?KL散度中超参数如何设计面试官想考察你是否真正理解GRPO(Group Relative Policy Optimization)中KL散度的设…→No.1194Q28:为什么使用强化学习会存在训练不稳定问题?为什么业界还在用面试官想考察你对 RL 在 LLM 对齐中核心问题的理解深度,而非单纯背诵 PPO 流程。刁钻点在于:既要解释“不稳定”…→No.1195Q30:LLM训练的时候为什么需要warmup面试官想看的不是“warmup是学习率从0慢慢升”这种概念背诵,而是你是否理解warmup在LLM训练中的数学动机和工程…→No.1196Q31:交叉熵和KL散度的联系和区别?PPO的KL散度可以改成交叉熵吗?分类任务可以用KL散度吗面试官想看你是否真正理解交叉熵和KL散度的数学本质,而非死记公式。这是典型的“概念辨析+工程迁移”题,刁钻点在于:PPO…→No.1197Q3:训练数据是否存在严重的分布偏移(Distribution Shift)?**面试官想看你是否真正理解RLHF/DPO训练中“数据分布”这个核心陷阱,而非只会跑开源代码。考察类型是工程取舍+debu…→No.1198Q47: DPO的loss是什么?**这道题考察的是对DPO(Direct Preference Optimization)损失函数的精确数学记忆和推导逻辑,…→No.1199Q6:如果在PPO训练过程中,KL散度惩罚项的系数 β 设置得过大或过小,分别会导致什么样的问题?你将如何通过实验和观察来调整这个超参数这道题考察的是PPO在RLHF中的超参数敏感性,尤其是KL惩罚系数β的工程调优能力。面试官想区分两类人:一类只背过“KL…→No.1200Q81: 增量预训练的过程当中,loss上升正常吗?**面试官想考察你对训练动态的底层理解,而非简单背诵“loss下降才正常”。刁钻点在于:增量预训练(Incremental …→No.1201Q82: 在增量预训练过程中如何设置学习率(learning rate, LR)?**面试官想考察你对增量预训练(Incremental Pretraining)超参数调优的实战经验,而非背诵理论。核心刁钻…→No.1202Q95: 怎么理解DPO的损失函数?**面试官想看你是否真正吃透DPO(Direct Preference Optimization)的数学直觉,而非仅背诵公式…→No.1203Q: DPO 和 PPO 在 Agent 场景下的选择和优劣势是什么?为什么 DPO 更稳定面试官想看你是否真正理解RLHF两种主流方法在Agent场景下的工程取舍,而非死记硬背概念。刁钻点在于:PPO是RLHF…→No.1204QLoRA呢?了解这个吗面试官想考察你对参数高效微调(PEFT)的深度理解,特别是QLoRA如何通过量化与LoRA的协同设计突破显存瓶颈。这不是…→No.1205Q:DPO 里的 \beta 到底控制什么?**面试官想看你是否真正理解DPO的数学本质,而非死记公式。这道题考察的是超参数工程直觉:β不是随便调的,它直接控制偏好优化…→No.1206Q:GRPO 相比 PPO 的核心价值是什么?**面试官想看你是否真正理解RLHF训练中的工程取舍,而非死记公式。这道题考察类型是“算法对比+系统设计”,刁钻点在于:GR…→No.1207Q:LoRA 里的 `B=0` 初始化为什么这么关键?**面试官想看你是否真正理解LoRA的数学本质,而非死记硬背“B=0”这个操作。这属于工程取舍+数学原理的混合考察。刁钻点在…→No.1208Q:RLHF 为什么通常要保留 Reference Model?**面试官考察你对 RLHF 训练流程的底层理解,而非简单背概念。核心是看你能不能解释清楚 Reference Model …→No.1209Q:为什么 BF16 逐渐取代 FP16 成为训练默认值?**面试官想考察你对混合精度训练底层数值格式的工程取舍理解,而非死记硬背“BF16 范围大”。刁钻点在于:你是否能说清 BF…→No.1210Q:为什么 PPO 里一定要有 Advantage,而不是直接拿 reward 更新?**面试官想看你是否真正理解策略梯度算法的核心问题——高方差,以及PPO如何通过Advantage函数解决它。这不是背概念题…→No.1211Q:为什么 SFT 时通常只对 Assistant 部分计算 Loss?**面试官想考察你对 SFT(监督微调)训练细节的深度理解,而非简单背诵概念。这是典型的“工程取舍 + 原理验证”题,刁钻点…→No.1212Q:为什么长上下文训练必须混合短文档数据?**面试官想考察你对长上下文训练中数据配比策略的深度理解,而非简单背诵“混合数据”的结论。这是典型的工程取舍+系统设计题,刁…→No.1213Q:什么时候会优先用 DPO,而不是直接上 RLHF?**面试官想看你是否真正理解RLHF和DPO背后的工程取舍,而非死记硬背公式。这道题属于算法选择与系统设计类,刁钻点在于:很…→No.1214Q:什么时候应该 merge LoRA,什么时候不 merge?**面试官想考察你对 LoRA 原理的深度理解,以及在实际训练和部署中的工程决策能力。这不是简单的“背概念”题,而是“工程取…→