FINETUNE · ALL

训练与微调 · 全部题目

共 310 篇,本页第 1-48 篇。← 回到学习路径视图

No.1在线 RL vs 离线偏好优化:训练范式怎么选在线 RL 探索充分冲上限、离线偏好稳定便宜。这篇给两种训练范式的对比表与混合使用的常见形态。…→No.1000领域模型Continue PreTrain ,如何 让模型在预训练过程中就学习到更多的知识面试官想考察你对“继续预训练”本质的理解——不是简单喂数据,而是如何在有限算力和灾难性遗忘约束下,最大化知识吸收效率。这…→No.1001进行SFT操作的时候,基座模型选用Chat还是Base面试官想考察你对大模型训练管线中“基座模型选择”的工程判断力,而非单纯背概念。这题是典型的系统设计取舍型问题,刁钻点在于…→No.1003想让模型学习某个领域或行业的知识,是应该预训练还是应该微调面试官想看你是否理解“知识注入”的本质区别,而非简单背概念。这道题考察的是工程决策能力:在资源、数据、效果三者约束下,选…→No.1004大模型LLM进行SFT 如何对样本进行优化面试官想考察你是否真正动手做过 SFT 数据工程,而非只背过“数据质量重要”这种空话。核心看三点:一是你是否理解数据质量…→No.1005为什么要增量预训练面试官想考察你是否真正理解“增量预训练”在LLM工程中的定位,而非单纯背概念。这属于工程取舍类型问题,刁钻点在于:很多人…→No.1007增量预训练所用训练框架面试官想考察你对增量预训练(Continual Pre-Training)工程落地的硬核理解,而非单纯背框架名字。刁钻点…→No.1008增量预训练数据选取思路有哪些面试官想考察你对大模型训练数据工程的系统性理解,而非简单背诵“质量、多样性”等概念。核心是看候选人能否从工程取舍和业务目…→No.1009增量预训练训练流程是怎么样面试官想考察你对大模型训练全流程的端到端理解,而非仅会调用`Trainer`。刁钻点在于:增量预训练不是简单“接着训”,…→No.1010有哪些省内存的大语言模型训练/微调/推理方法面试官想看你是否系统性地掌握了LLM全生命周期的内存优化技术,而非零散地背几个名词。考察类型是系统设计+工程取舍。刁钻点…→No.1011简单介绍一下 RLHF面试官想考察你对RLHF(Reinforcement Learning from Human Feedback)的完整流…→No.1012RLHF 在实践过程中存在哪些不足面试官想考察你对RLHF从理论到落地的系统性认知,而非背诵“奖励模型难训”这种空话。刁钻点在于:区分“理论缺陷”与“工程…→No.10134-5** QA:请问不打破数据相关性,神经网络的训练效果为什么就不好这道题表面问“数据相关性为什么影响训练”,实则考察对监督学习核心假设(独立同分布)与强化学习训练稳定性之间关系的理解深度…→No.1014那么在RLHF中到底有几个模型?他们是怎么配合做训练的?而我们最终要的是哪个模型面试官想考察你对RLHF(基于人类反馈的强化学习)全流程的系统理解,而不仅仅是背诵“PPO”三个字母。这道题的刁钻点在于…→No.1015那么问题来了, 怎么找到这样的一个演员\theta',使其收集到的数据可以用于训练\theta,且他们之间的差异可以被忽略不计呢面试官想考察你对Off-Policy RL 中策略差异控制的底层理解,而非单纯背诵 PPO 公式。刁钻点在于:题目中“差…→No.1016那么怎么避免差太多呢?这就是 PPO 在做的事情面试官想考察你对PPO(Proximal Policy Optimization)在LLM训练中核心机制的理解,尤其是它…→No.1017在大模型训练过程中,产生了许多无用甚至是错误的信息,而我们在工作中只是采用了许多方式来规避这些错误的信息,但为什么不试图去删掉它们呢?如果能够将这些信息替换为有价值的信息,那将是一件有价值的事面试官真正想看的不是“要不要删错误数据”这种表面答案,而是你对训练数据噪声的本质理解和工程取舍能力。这道题属于系统设计+…→No.1018为什么 SFT 时通常只对 Assistant 部分计算 Loss面试官想考察你对 SFT(监督微调)训练细节的深度理解,而非简单背诵概念。这是典型的“工程取舍 + 原理验证”题,刁钻点…→No.1019RLHF 为什么通常要保留 Reference Model面试官考察你对 RLHF 训练流程的底层理解,而非简单背概念。核心是看你能不能解释清楚 Reference Model …→No.1020为什么 PPO 里一定要有 Advantage,而不是直接拿 reward 更新面试官想看你是否真正理解策略梯度算法的核心问题——高方差,以及PPO如何通过Advantage函数解决它。这不是背概念题…→No.1021既然知道最优解的形式,能不能用偏好数据直接拟合这个最优解,**跳过 RM 训练和 RL 训练**?**答案:可以面试官想看你是否真正理解RLHF的数学本质,而非只会调包。这道题表面是问“能不能跳过RM和RL”,实则考察你对DPO(D…→No.1022训练数据是否存在严重的分布偏移(Distribution Shift)面试官想看你是否真正理解RLHF/DPO训练中“数据分布”这个核心陷阱,而非只会跑开源代码。考察类型是工程取舍+debu…→No.1023DPO 里的 \beta 到底控制什么面试官想看你是否真正理解DPO的数学本质,而非死记公式。这道题考察的是超参数工程直觉:β不是随便调的,它直接控制偏好优化…→No.1024什么时候会优先用 DPO,而不是直接上 RLHF面试官想看你是否真正理解RLHF和DPO背后的工程取舍,而非死记硬背公式。这道题属于算法选择与系统设计类,刁钻点在于:很…→No.1025GRPO 的灵魂问题:** 能不能用更简单的方式算出基线,直接省掉 Critic面试官真正想看的不是 GRPO 的流程背诵,而是你能否从强化学习基线设计的底层逻辑出发,解释“为什么 GRPO 能省掉 …→No.1026GRPO 相比 PPO 的核心价值是什么面试官想看你是否真正理解RLHF训练中的工程取舍,而非死记公式。这道题考察类型是“算法对比+系统设计”,刁钻点在于:GR…→No.1027Rejection Sampling SFT 为什么没有天花板面试官想看你是否真正理解SFT与强化学习(RL)在优化范式上的本质差异,而非停留在“Rejection Sampling…→No.1029LoRA 里的 `B=0` 初始化为什么这么关键面试官想看你是否真正理解LoRA的数学本质,而非死记硬背“B=0”这个操作。这属于工程取舍+数学原理的混合考察。刁钻点在…→No.1030什么时候应该 merge LoRA,什么时候不 merge面试官想考察你对 LoRA 原理的深度理解,以及在实际训练和部署中的工程决策能力。这不是简单的“背概念”题,而是“工程取…→No.1031为什么 BF16 逐渐取代 FP16 成为训练默认值面试官想考察你对混合精度训练底层数值格式的工程取舍理解,而非死记硬背“BF16 范围大”。刁钻点在于:你是否能说清 BF…→No.1032为什么长上下文训练必须混合短文档数据面试官想考察你对长上下文训练中数据配比策略的深度理解,而非简单背诵“混合数据”的结论。这是典型的工程取舍+系统设计题,刁…→No.1033**Q1:SFT 为什么只对 assistant token 算 loss?多轮时所有 ASST 都要开放吗面试官想验证你是否真正动手训过 SFT,而非只背过“只对 assistant 算 loss”的结论。考察类型是工程取舍 …→No.1034**Q3:什么是 PSFT?为什么值得在面试里提面试官想考察你是否真正理解LLM训练范式的演进,而非仅仅背诵“SFT→RLHF”的流水账。PSFT(Preference…→No.1035**Q11:RLHF 完整流程?为什么 SFT 不够面试官想考察你对 LLM 对齐技术的深度理解,而非单纯背诵流程。核心是:你是否能解释清楚 SFT 的“模仿学习”本质缺陷…→No.1036**Q12:PPO 完整目标函数?每项作用这道题考察的是对PPO(Proximal Policy Optimization)目标函数的精确数学理解,而非泛泛背诵。…→No.1037**Q14:DPO 怎么从 RLHF 推出来面试官想看你是否真正理解RLHF的数学骨架,而非只会调库。考察类型是数学推导+工程取舍。刁钻点在于:DPO论文(2023…→No.1038**Q15:DPO 的 β 作用?核心缺陷面试官想确认你是否真正理解DPO(Direct Preference Optimization)的数学直觉和工程陷阱,而…→No.1039**Q16:GRPO 和 PPO 本质区别面试官想考察你对强化学习在LLM训练中落地的深度理解,而非单纯背诵算法公式。这是典型的“工程取舍+系统设计”题,刁钻点在…→No.1040**Q21:R1 为什么需要 Cold-start SFT面试官想看你是否理解强化学习(RL)训练大模型的“冷启动”问题,而非单纯背诵SFT流程。考察类型是工程取舍与系统设计结合…→No.1041**Q:GRPO 中 G 取多少合适面试官想考察你对 GRPO(Group Relative Policy Optimization)超参数敏感性的理解深度…→No.1042**Q:Online DPO 相比 Offline DPO 的代价是什么面试官想看你是否真正理解 DPO 变体在训练效率与对齐效果之间的工程取舍,而非仅仅背诵公式。这是典型的“工程取舍”+“系…→No.1043**Q:什么情况下 LoRA 权重要合并,什么时候不合并面试官想考察你对 LoRA 从训练到部署的整条链路理解,而非仅背概念。核心是区分“推理优化”与“服务灵活性”的工程取舍。…→No.1044和传统SFT相比,RLHF旨在解决语言模型中的哪些核心问题?为什么说SFT本身不足以实现我们期望的「对齐「目标面试官想考察你是否真正理解“对齐”的工程本质,而非背诵RLHF流程。核心是:SFT为什么不够?RLHF解决了SFT的哪些…→No.1045为什么选择PPO,而不是其他更简单的策略梯度算法(如REINFORCE)或者Q-learning系算法?PPO中的KL散度惩罚项起到了什么关键作用面试官想看你是否真正理解PPO在LLM RLHF中的“不可替代性”,而非仅仅背诵公式。考察类型是工程取舍+系统设计。刁钻…→No.1046如果在PPO训练过程中,KL散度惩罚项的系数 β 设置得过大或过小,分别会导致什么样的问题?你将如何通过实验和观察来调整这个超参数这道题考察的是PPO在RLHF中的超参数敏感性,尤其是KL惩罚系数β的工程调优能力。面试官想区分两类人:一类只背过“KL…→No.1047SFT 的 loss 如何只计算回答部分?(如何 ignore padding token?)面试官真正想看的不是你会不会调 `CrossEntropyLoss(ignore_index=-100)`,而是你是否理…→No.1050SFT+DPO训练怎么组织这部分数据的?是自己构造还是用公开数据面试官想看你是否真正理解SFT和DPO两阶段训练的数据本质差异,而不仅仅是背流程。核心考察点:SFT数据是“模仿正确答案…→No.1051SFT 的数据集是越大越好吗?会存在scaling law 吗面试官想看你是否理解SFT(监督微调)与预训练在数据规模上的本质差异,以及能否辩证看待“Scaling Law”的适用范…→