FINETUNE · ALL
训练与微调 · 全部题目
共 310 篇,本页第 145-192 篇。← 回到学习路径视图
No.1222Transformer训练的时候学习率是如何设定的?Dropout是如何设定的,位置在哪里?Dropout 在测试的需要有什么需要注意的吗?**这道题是典型的“训练工程细节”考察,面试官想看你是否真正动手训过 Transformer,还是只停留在调包层面。核心考察…→No.1223What are some challenges or limitations of RLHF?**面试官想看你是否真正动手调过RLHF,而非只背了“PPO+奖励模型”的流程。这道题属于工程取舍+debug类型,刁钻点在…→No.1224What are the different categories of the PEFT method?**面试官想看的不是“你背过PEFT分类”,而是能否从工程取舍和系统设计角度,把PEFT方法按“修改模型结构”和“修改输入/…→No.1225What is Direct Preference Optimization (DPO), and how does it differ from RLHF?**面试官想看你是否真正理解偏好对齐(Preference Alignment)的底层逻辑,而非只会背论文标题。考察类型是工…→No.1226What is “reward hacking” in RLHF and how does it impact preference tuning?**面试官想看你是否真正理解RLHF的“奖励过拟合”陷阱,而非只背流程。考察类型是工程取舍+debug:刁钻点在于,候选人常…→No.1228When should you use preference alignment methods instead of supervised fine-tuning (SFT)?**面试官想考察你对 LLM 训练管线中两个核心阶段——SFT 和偏好对齐——的边界判断能力,而非单纯背诵概念。刁钻点在于:…→No.1233❓ **Q11:RLHF 完整流程?为什么 SFT 不够?**面试官想考察你对 LLM 对齐技术的深度理解,而非单纯背诵流程。核心是:你是否能解释清楚 SFT 的“模仿学习”本质缺陷…→No.1234❓ **Q12:PPO 完整目标函数?每项作用?**这道题考察的是对PPO(Proximal Policy Optimization)目标函数的精确数学理解,而非泛泛背诵。…→No.1235❓ **Q14:DPO 怎么从 RLHF 推出来?**面试官想看你是否真正理解RLHF的数学骨架,而非只会调库。考察类型是数学推导+工程取舍。刁钻点在于:DPO论文(2023…→No.1236❓ **Q15:DPO 的 β 作用?核心缺陷?**面试官想确认你是否真正理解DPO(Direct Preference Optimization)的数学直觉和工程陷阱,而…→No.1237❓ **Q16:GRPO 和 PPO 本质区别?**面试官想考察你对强化学习在LLM训练中落地的深度理解,而非单纯背诵算法公式。这是典型的“工程取舍+系统设计”题,刁钻点在…→No.1238❓ **Q1:SFT 为什么只对 assistant token 算 loss?多轮时所有 ASST 都要开放吗?**面试官想验证你是否真正动手训过 SFT,而非只背过“只对 assistant 算 loss”的结论。考察类型是工程取舍 …→No.1239❓ **Q21:R1 为什么需要 Cold-start SFT?**面试官想看你是否理解强化学习(RL)训练大模型的“冷启动”问题,而非单纯背诵SFT流程。考察类型是工程取舍与系统设计结合…→No.1240❓ **Q3:什么是 PSFT?为什么值得在面试里提?**面试官想考察你是否真正理解LLM训练范式的演进,而非仅仅背诵“SFT→RLHF”的流水账。PSFT(Preference…→No.1241❓ **Q:GRPO 中 G 取多少合适?**面试官想考察你对 GRPO(Group Relative Policy Optimization)超参数敏感性的理解深度…→No.1242❓ **Q:Online DPO 相比 Offline DPO 的代价是什么?**面试官想看你是否真正理解 DPO 变体在训练效率与对齐效果之间的工程取舍,而非仅仅背诵公式。这是典型的“工程取舍”+“系…→No.1243❓ **Q:什么情况下 LoRA 权重要合并,什么时候不合并?**面试官想考察你对 LoRA 从训练到部署的整条链路理解,而非仅背概念。核心是区分“推理优化”与“服务灵活性”的工程取舍。…→No.1253你认为高质量的人工合成数据在未来的模型训练中将扮演什么样的角色?**面试官想看你是否真正理解合成数据在LLM训练中的“双刃剑”本质,而非简单吹捧或贬低。考察类型是工程取舍+系统设计,刁钻点…→No.1282第二个问题:MoE 如何解决训练稳定性问题?**面试官想考察你对 MoE(Mixture of Experts)训练中核心问题的系统性理解,而非简单背诵概念。这是典型的…→No.1300项目:SFT使用的数据集,使用了多少张卡?SFT训练多久面试官想看你是否真正动手训过模型,而非只背过论文。这道题表面问“多少卡、多久”,实则考察三个层次:资源估算能力(从模型参…→No.1301项目:你提到用DeepSpeed做SFT训练,请讲一下DeepSpeed ZeRO Stage 1-3的区别,以及什么时候用FSDP会更好面试官想确认你是否真正理解分布式训练的内存优化原理,而非只背过“ZeRO分三阶段”的结论。考察类型是工程取舍+系统设计,…→No.1302项目:在项目中你用过 DPO 吗?和 PPO 相比,它有什么优缺点面试官想看你是否真正理解RLHF两种主流方法的底层逻辑和工程取舍,而非背诵“DPO简单、PPO复杂”的结论。考察类型是工…→No.1303项目:说下LoRA的原理,LoRA是不是只能在Linear层插?为什么不能插在LayerNorm之后?这会对训练稳定性造成什么影响面试官想考察你对 LoRA 的原理级理解,而非背诵“低秩分解”定义。刁钻点在于:LoRA 的适用性边界——为什么它天然适…→No.1308📌 Q101: What is LoRA, and how does it work at a high level面试官想考察你对参数高效微调(PEFT)核心方法的理解深度,而非简单背诵 LoRA 定义。刁钻点在于:你是否能讲清低秩分…→No.1309📌 Q103: What is QLoRA, and how does it differ from LoRA面试官想考察你对参数高效微调(PEFT)技术的深度理解,尤其是量化与微调的结合。这不是简单的背概念题,刁钻点在于:你是否…→No.1310📌 Q104: When would you use QLoRA instead of standard LoRA面试官想看你是否真正理解参数高效微调(PEFT)的工程取舍,而非仅背诵概念。这道题考察类型是工程取舍分析,刁钻点在于:Q…→No.1312**手推 PPO/DPO 损失函数?**面试官想验证你对 RLHF 核心算法的数学理解深度,而非单纯背诵公式。考察类型为 数学推导 + 工程取舍。刁钻点在于:P…→No.1313对于长度较长的语料,如何训练面试官想考察你对长序列训练技术栈的深度与广度,而非仅背诵“用稀疏注意力”这种表面答案。核心刁钻点在于:你是否理解不同方案…→No.1314Agentic RL 的方法和训练框架面试官想考察你对强化学习(RL)在 Agent 场景下应用的理解深度,而非简单背诵 PPO 公式。核心看三点:第一,是否…→No.1315At which stage you will decide to go for the Preference alignment type of method rather than SFT?**面试官想考察的不是你是否背熟了RLHF/DPO的概念,而是你在真实工程流水线中,面对“模型已经SFT过了,但输出仍然不满…→No.1317GRPO/GSPO训练流程是什么?一条数据的处理逻辑和损失计算的方式是怎么样的?GSPO相比GRPO的改进是什么?GSPO训练的时候 损失函数是怎么设计的?为什么数据量相同的时候,GSPO比GRPO优化的效果更好面试官想考察你对 RLHF 领域前沿偏好优化算法的数学原理与工程实现差异的掌握程度,而非简单背诵流程。刁钻点在于:能否清…→No.1318GRPO的kl散度和PPO的kl散度区别?K1 K2 K3估计区别这道题考察的是对强化学习(RL)在LLM对齐中核心机制的理解深度,属于工程取舍 + 算法原理的综合型问题。面试官真正想看…→No.1319GSPO和DAPO有听说过吗?他们和GRPO有什么区别面试官想考察你对 RLHF 前沿变体的广度与深度,而非仅仅背名字。核心是区分你是否理解 GRPO 的“组内相对奖励”本质…→No.1320LoRA和Prompt tuning这两种方法你在sft的时候是怎么选择的面试官想考察你在 SFT 场景下对 PEFT 方法的工程决策能力,而非单纯背诵概念。刁钻点在于:LoRA 和 Promp…→No.1321PPO和DPO在大模型对齐中的主要区别是什么?DPO训练通常有哪些注意事项?用过GRPO么面试官想考察你对 RLHF 对齐方法的原理级理解,而非背诵概念。核心是:PPO 和 DPO 的数学本质差异(在线 vs …→No.1322PPO的原理?从维护的四个model讲,再详细讲一下训练流程和损失函数各个参数含义面试官考察你对PPO(Proximal Policy Optimization)在LLM对齐中的工程化理解,而非单纯背论…→No.1323PPO(强化学习)的数据格式面试官想考察你对PPO在LLM微调中数据管道的理解深度,而非单纯背概念。刁钻点在于:LLM的PPO与传统RL的PPO数据…→No.1324Q10:你知道Deepseek的GRPO吗,它和PPO的主要区别是什么?优劣是什么面试官想考察你对 RLHF 前沿变体的理解深度,以及能否从工程和理论层面对比 PPO 与 GRPO。这属于系统设计 + …→No.1325Q11:GSPO和DAPO有听说过吗?他们和GRPO有什么区别这道题考察的是你对LLM后训练(post-training)前沿RLHF变体的追踪深度和对比分析能力,属于前沿追踪+工程…→No.1326Q14:在训练一个百或千亿参数级别的 LLM 时,你会面临哪些主要的工程和算法挑战?(例如:显存、通信、训练不稳定性等)面试官想考察你是否有真正动手训过大模型的实战经验,而非只会调库。这是一道系统设计 + 工程取舍题,刁钻点在于:候选人常只…→No.1327Q23:PPO/GRPO 微调后,如何防止模型在分布外(OOD)问题上性能崩塌面试官想看你是否真正理解RL微调(PPO/GRPO)导致OOD性能崩塌的底层机制,而非只背口诀。考察类型是工程取舍+系统…→No.1328Q24:是否自己实现过 RLHF 流程?不用框架能否手写 PPO 核心逻辑面试官想验证你是否真正理解RLHF和PPO的数学原理,而非仅会调TRL/DeepSpeed库。考察类型是系统设计+工程取…→No.1329Q25:为什么PPO要用value baseline和GAE?它们如何让训练更稳定面试官想看你是否真正理解PPO中两个关键组件——value baseline和GAE——背后的理论动机,而不仅仅是背公式…→No.1330Q26:为什么GRPO在训练MOE时会出问题?原因是啥,怎么改进策略面试官想考察你对GRPO(Group Relative Policy Optimization)和MoE(Mixture…→No.1331Q52: agent调用工具不正确怎么办,采用sft或者强化学习怎么来解决?**面试官想考察你能否从系统层面诊断 Agent 工具调用失败,并区分 SFT 和强化学习的适用边界。这不是背概念题,而是工…→No.1332Q:怎么一句话区分 DAPO / VAPO / GSPO?**面试官想考察你对 RLHF 最新变体(DAPO/VAPO/GSPO)的原理级理解,而非死记硬背缩写。这属于系统设计 + …→No.1333Q:推理时 Expert Parallelism 和训练时有什么区别?**面试官想考察你对 MoE 模型分布式并行策略在训练与推理两个阶段差异的深度理解,而非简单背诵概念。刁钻点在于:训练时 E…→No.1334RLHF必问:RLHF训练流程?存在哪些潜在风险(比如奖励黑客、过拟合等)面试官真正想看的是:你是否真正动手跑过RLHF,还是只背了“三阶段”的PPT。这道题表面考流程,实则考风险意识和工程取舍…→