---
name: llm-post-training
description: 大模型后训练深挖：RL 与奖励设计、推理模型训练、参数高效微调、数据合成与蒸馏、对齐税。
keywords: [后训练, post-training, rlhf, dpo, grpo, dapo, rlvr, 奖励模型, reward model, 推理模型, reasoning, lora, qlora, sft 数据, 合成数据, 蒸馏, 对齐税]
layer: detail
domains: [ai-algorithm]
---

## 面试官在意什么

这本是 ai-algorithm 里后训练那一段的深挖：SFT 之后模型怎么变强、怎么变可控。2026 年的面试重点是可验证奖励的 RL（GRPO、DAPO 与各家变体）、推理模型的训练细节、奖励怎么被 hack、合成数据怎么不把模型带偏。面试官会要求推导 DPO、写出 GRPO 目标里的裁剪与 KL 项、算 LoRA 的显存账，并追一次真实的训练事故：奖励 hack、长度膨胀、熵坍缩、评测污染。

## 项目 / 实习怎么深挖

简历上出现下面这类经历时从哪里切、追什么。追到候选人能说出机制、数字的来源与一次真实的故障或取舍才算实；只有框架名与结论、说不出自己那一段的，记为危险信号。通用的追问方法见 project-deep-dive。

- 简历出现 RLHF / DPO / GRPO → 追偏好或奖励怎么来、有没有观察到 reward hacking、KL 与裁剪系数怎么调、和 SFT 基线涨在哪
- 简历出现推理模型 / 长思维链 → 追可验证奖励怎么设计与判分、长度膨胀怎么控、在不可验证任务上怎么迁移
- 简历出现 LoRA / QLoRA → 追 rank 与目标层、显存账、和全参对比、合并后有没有回归
- 简历出现数据合成 / 蒸馏 → 追教师模型、过滤规则、多样性与错误率怎么量、有没有验证过合成数据的收益
- 简历出现奖励模型 → 追训练数据、和人工一致性、过优化怎么发现
- 简历出现"评测涨 X 分" → 追污染检查、种子数、方差、对齐税（通用能力掉了多少）

## 常见失守与危险信号

- RL 与奖励设计：说不出 GRPO 与 PPO 的差别；不知道奖励可以被 hack；把"思维链更长"当能力更强
- 奖励模型与判分器：判分器只做字符串匹配；奖励模型没和人工对过；不知道过优化
- 推理模型训练：只会"用 R1 的方法"；说不出冷启动 SFT 的作用；长度与熵不一起看
- 参数高效微调：只知道 LoRA 的名字；算不出显存；合并权重后不做回归
- 数据合成与蒸馏：合成数据不过滤直接训；不知道分布坍缩；蒸馏只答"用大模型生成答案"
- 数据配比与课程：配比拍脑袋；不知道通用数据抗遗忘；没做过消融
- 对齐税与回归：只看目标任务分数；不知道通用能力与安全性可能同时下降
- 在线与离线：分不清 on-policy 与 off-policy 对数据新鲜度的要求；DPO 数据来自别的模型却不觉得有问题

## 常考主题清单

只列名字、阶梯与答实的标志，作"问到哪一层算实"的参考；问哪些、问几道由这份 JD 与这份简历定，不是配额。

### RL for LLM：奖励设计与推理模型
- 阶梯：为什么推理能力用 RL 而不是 SFT 提升 → GRPO 相对 PPO 去掉了什么、优势怎么估计、组采样的代价 → 可验证奖励（数学、代码）怎么设计与判分，格式奖励与长度控制，不可验证任务怎么办（奖励模型、成对判别） → 训练不稳定、熵坍缩、奖励 hack、长度膨胀的诊断与处理；推理时算力与训练时算力的取舍
- 答实的标志：能说出 GRPO 目标里的裁剪与 KL 项；判分器有防 hack 的设计（答案抽取、多解校验）；有训练曲线里熵、长度、奖励三条线一起看的习惯；能讨论蒸馏推理数据 vs 直接 RL 的适用场景

### 参数高效微调与显存账
- 阶梯：全参数微调与 LoRA 等方法的差异 → LoRA 的低秩假设、rank 与 alpha、挂哪些层；QLoRA 省在哪 → 微调 7B / 70B 各要多少显存，梯度、优化器状态、激活各占多少 → 何时该全参、何时够 LoRA；合并权重与多适配器服务
- 答实的标志：能算参数量与显存（权重、梯度、Adam 状态、激活）；知道 rank 增大收益递减；合并后做回归评测；提到梯度检查点与 ZeRO 的取舍

### 数据合成、蒸馏与去污染
- 阶梯：为什么要合成数据 → 用教师模型生成、过滤、多样性控制的流程；拒绝采样与自我改进 → 合成数据的错误率与分布坍缩怎么检测；评测污染怎么发现（n-gram 重叠、困惑度、时间切分） → 蒸馏（软标签、推理链）与直接训练的取舍；合成数据的版权与许可边界
- 答实的标志：合成数据有抽检错误率与多样性指标；训练前做评测集去污染；能说出一次因合成数据导致模型退化的案例

### 奖励模型与判分器设计
- 阶梯：可验证任务（数学、代码、格式）与不可验证任务（写作、对话）的奖励各怎么来 → 规则判分器怎么防 hack（答案抽取、多解校验、单元测试）；奖励模型怎么训、怎么和人工对齐 → 奖励过优化的表现（分数涨输出变差）与检测（留出奖励模型、人工抽检）→ 混合奖励（正确性 + 格式 + 长度惩罚）的权重怎么定
- 答实的标志：判分器有防 hack 设计；奖励模型与人工一致性有数字；能说出一次过优化的案例与处理

### 推理模型的训练细节
- 阶梯：为什么纯 RL 能激发长思维链；冷启动 SFT 起什么作用 → 训练曲线里奖励、长度、熵三条线怎么一起看；熵坍缩、长度膨胀、格式崩坏各怎么处理 → 推理数据蒸馏到小模型与直接 RL 的适用场景 → 推理时算力（更长思考）与训练时算力的取舍；思考长度怎么按任务控
- 答实的标志：有三条线一起看的习惯；能说出蒸馏 vs RL 的选择依据；知道长度控制的具体手段

### 数据配比与训练课程
- 阶梯：SFT 与 RL 阶段的数据各来自哪、比例怎么定 → 通用数据、领域数据、安全数据混合的比例对遗忘与目标任务的影响 → 课程（先易后难、先短后长）什么时候有用 → 配比消融怎么做、成本多少
- 答实的标志：配比有消融依据；知道混合通用数据抗遗忘；能说出一次配比改动的前后对比

### 对齐税与后训练回归
- 阶梯：什么是对齐税：目标任务涨、通用能力或安全性掉 → 后训练每一步都要回归哪些评测（通用、安全、目标、格式）→ 掉了怎么归因是数据、算法还是超参 → 回归成本与迭代速度的平衡
- 答实的标志：每步都有回归评测；能说出一次掉分的归因；知道哪些能力最容易被牺牲

### 在线与离线对齐
- 阶梯：on-policy RL 与 off-policy 偏好优化对数据的要求差在哪 → DPO 数据来自别的模型会怎样；迭代式 DPO 与在线采样的关系 → 什么时候 DPO 够用、什么时候必须在线 RL → rollout 与训练的系统开销与吞吐
- 答实的标志：能说出 on/off-policy 的具体后果；有 DPO 与在线 RL 的取舍依据；知道 rollout 是成本大头
