llm-post-training · git:20260920.a4843f5 · 2026-09-20 · sha256 ad34774b75739f79
llm-post-training git:20260920.a4843f5A
Immutable. This exact content is served forever at /api/v1/blob/ad34774b75739f79.
--- name: llm-post-training description: 大模型后训练深挖:RL 与奖励设计、推理模型训练、参数高效微调、数据合成与蒸馏、对齐税。 keywords: [后训练, post-training, rlhf, dpo, grpo, dapo, rlvr, 奖励模型, reward model, 推理模型, reasoning, lora, qlora, sft 数据, 合成数据, 蒸馏, 对齐税] layer: detail domains: [ai-algorithm] --- ## 面试官在意什么 这本是 ai-algorithm 里后训练那一段的深挖:SFT 之后模型怎么变强、怎么变可控。2026 年的面试重点是可验证奖励的 RL(GRPO、DAPO 与各家变体)、推理模型的训练细节、奖励怎么被 hack、合成数据怎么不把模型带偏。面试官会要求推导 DPO、写出 GRPO 目标里的裁剪与 KL 项、算 LoRA 的显存账,并追一次真实的训练事故:奖励 hack、长度膨胀、熵坍缩、评测污染。 ## 项目 / 实习怎么深挖 简历上出现下面这类经历时从哪里切、追什么。追到候选人能说出机制、数字的来源与一次真实的故障或取舍才算实;只有框架名与结论、说不出自己那一段的,记为危险信号。通用的追问方法见 project-deep-dive。 - 简历出现 RLHF / DPO / GRPO → 追偏好或奖励怎么来、有没有观察到 reward hacking、KL 与裁剪系数怎么调、和 SFT 基线涨在哪 - 简历出现推理模型 / 长思维链 → 追可验证奖励怎么设计与判分、长度膨胀怎么控、在不可验证任务上怎么迁移 - 简历出现 LoRA / QLoRA → 追 rank 与目标层、显存账、和全参对比、合并后有没有回归 - 简历出现数据合成 / 蒸馏 → 追教师模型、过滤规则、多样性与错误率怎么量、有没有验证过合成数据的收益 - 简历出现奖励模型 → 追训练数据、和人工一致性、过优化怎么发现 - 简历出现"评测涨 X 分" → 追污染检查、种子数、方差、对齐税(通用能力掉了多少) ## 常见失守与危险信号 - RL 与奖励设计:说不出 GRPO 与 PPO 的差别;不知道奖励可以被 hack;把"思维链更长"当能力更强 - 奖励模型与判分器:判分器只做字符串匹配;奖励模型没和人工对过;不知道过优化 - 推理模型训练:只会"用 R1 的方法";说不出冷启动 SFT 的作用;长度与熵不一起看 - 参数高效微调:只知道 LoRA 的名字;算不出显存;合并权重后不做回归 - 数据合成与蒸馏:合成数据不过滤直接训;不知道分布坍缩;蒸馏只答"用大模型生成答案" - 数据配比与课程:配比拍脑袋;不知道通用数据抗遗忘;没做过消融 - 对齐税与回归:只看目标任务分数;不知道通用能力与安全性可能同时下降 - 在线与离线:分不清 on-policy 与 off-policy 对数据新鲜度的要求;DPO 数据来自别的模型却不觉得有问题 ## 常考主题清单 只列名字、阶梯与答实的标志,作"问到哪一层算实"的参考;问哪些、问几道由这份 JD 与这份简历定,不是配额。 ### RL for LLM:奖励设计与推理模型 - 阶梯:为什么推理能力用 RL 而不是 SFT 提升 → GRPO 相对 PPO 去掉了什么、优势怎么估计、组采样的代价 → 可验证奖励(数学、代码)怎么设计与判分,格式奖励与长度控制,不可验证任务怎么办(奖励模型、成对判别) → 训练不稳定、熵坍缩、奖励 hack、长度膨胀的诊断与处理;推理时算力与训练时算力的取舍 - 答实的标志:能说出 GRPO 目标里的裁剪与 KL 项;判分器有防 hack 的设计(答案抽取、多解校验);有训练曲线里熵、长度、奖励三条线一起看的习惯;能讨论蒸馏推理数据 vs 直接 RL 的适用场景 ### 参数高效微调与显存账 - 阶梯:全参数微调与 LoRA 等方法的差异 → LoRA 的低秩假设、rank 与 alpha、挂哪些层;QLoRA 省在哪 → 微调 7B / 70B 各要多少显存,梯度、优化器状态、激活各占多少 → 何时该全参、何时够 LoRA;合并权重与多适配器服务 - 答实的标志:能算参数量与显存(权重、梯度、Adam 状态、激活);知道 rank 增大收益递减;合并后做回归评测;提到梯度检查点与 ZeRO 的取舍 ### 数据合成、蒸馏与去污染 - 阶梯:为什么要合成数据 → 用教师模型生成、过滤、多样性控制的流程;拒绝采样与自我改进 → 合成数据的错误率与分布坍缩怎么检测;评测污染怎么发现(n-gram 重叠、困惑度、时间切分) → 蒸馏(软标签、推理链)与直接训练的取舍;合成数据的版权与许可边界 - 答实的标志:合成数据有抽检错误率与多样性指标;训练前做评测集去污染;能说出一次因合成数据导致模型退化的案例 ### 奖励模型与判分器设计 - 阶梯:可验证任务(数学、代码、格式)与不可验证任务(写作、对话)的奖励各怎么来 → 规则判分器怎么防 hack(答案抽取、多解校验、单元测试);奖励模型怎么训、怎么和人工对齐 → 奖励过优化的表现(分数涨输出变差)与检测(留出奖励模型、人工抽检)→ 混合奖励(正确性 + 格式 + 长度惩罚)的权重怎么定 - 答实的标志:判分器有防 hack 设计;奖励模型与人工一致性有数字;能说出一次过优化的案例与处理 ### 推理模型的训练细节 - 阶梯:为什么纯 RL 能激发长思维链;冷启动 SFT 起什么作用 → 训练曲线里奖励、长度、熵三条线怎么一起看;熵坍缩、长度膨胀、格式崩坏各怎么处理 → 推理数据蒸馏到小模型与直接 RL 的适用场景 → 推理时算力(更长思考)与训练时算力的取舍;思考长度怎么按任务控 - 答实的标志:有三条线一起看的习惯;能说出蒸馏 vs RL 的选择依据;知道长度控制的具体手段 ### 数据配比与训练课程 - 阶梯:SFT 与 RL 阶段的数据各来自哪、比例怎么定 → 通用数据、领域数据、安全数据混合的比例对遗忘与目标任务的影响 → 课程(先易后难、先短后长)什么时候有用 → 配比消融怎么做、成本多少 - 答实的标志:配比有消融依据;知道混合通用数据抗遗忘;能说出一次配比改动的前后对比 ### 对齐税与后训练回归 - 阶梯:什么是对齐税:目标任务涨、通用能力或安全性掉 → 后训练每一步都要回归哪些评测(通用、安全、目标、格式)→ 掉了怎么归因是数据、算法还是超参 → 回归成本与迭代速度的平衡 - 答实的标志:每步都有回归评测;能说出一次掉分的归因;知道哪些能力最容易被牺牲 ### 在线与离线对齐 - 阶梯:on-policy RL 与 off-policy 偏好优化对数据的要求差在哪 → DPO 数据来自别的模型会怎样;迭代式 DPO 与在线采样的关系 → 什么时候 DPO 够用、什么时候必须在线 RL → rollout 与训练的系统开销与吞吐 - 答实的标志:能说出 on/off-policy 的具体后果;有 DPO 与在线 RL 的取舍依据;知道 rollout 是成本大头