(6 封私信 / 3 条消息) On-Policy Distillation 与 Self-Distillation:七篇论文的阅读笔记 - 知乎
大语言模型的后训练在很长一段时间内有两种主要的方式。第一个是监督微调(SFT)/ off-Policy Distillation它以高密度 token 监督换取训练稳定性,但训练分布由数据集或教师采样固定给定,是一种 off-policy 的训练;第二条主线是强化学习(RLHF/RLVR),它以 on-policy 采样直接优化当前策略的行为,但奖励通常是稀疏、延迟且高方差的。 On-policy distillation 的关键意义在于把两种方法的优点进行组合:采样来自当前学生策略,监督却来自教师分布的密集 token 级信号,从而同时具备了 On-policy 和奖励密集的两个优点。七篇论文对 On-Policy Distillation 在算法和工程上进行了探索:从 GKD 的 on-policy KD 统一化,到 MiniLLM 的 sequence-level reverse KL,再到 G-OPD 的奖励外推、OPSD/SDFT/SDPO 的自蒸馏扩展,以及工程化经验总结。 设真实或教师分布为 𝑃 ,学生模型分布为 𝑄 𝜃 。前向散度定义为 𝐷 K L ( 𝑃 ‖ 𝑄 𝜃 ) = ∑ 𝑦 𝑃 ( 𝑦 ) log 𝑃 ( 𝑦 ) 𝑄 𝜃 ( 𝑦 ) = 𝐸 𝑦 ∼ 𝑃 [ log 𝑃 ( 𝑦 ) − log 𝑄 𝜃 ( 𝑦 ) ] . 由于 𝐸 𝑃 [ log 𝑃 ( 𝑦 ) ] 与 𝜃 无关,可得 min 𝜃 𝐷 K L ( 𝑃 ‖ 𝑄 𝜃 ) ⟺ max 𝜃 𝐸 𝑦 ∼ 𝑃 [ log 𝑄 𝜃 ( 𝑦 ) ] , 这正是最大似然估计(MLE)与 SFT 的数学形式。因此 SFT 可以被严格解释为“用 one-hot 目标最小化前向 KL”的特殊情形,标准 KD 则是把 one-hot 换成教师 soft label,但仍然保持前向 KL 结构。 前向 KL 的期望是在教师/数据分布上取的, 𝑃 中概率越高的区域在目标里权重越大;如果学生在这些区域给出过低概率,会产生明显惩罚。与此同时,前向 KL 对“学生在低概率区域的质量分配”的权重较低,容忍度较高,因此整体表现出来 mode covering 的行为。因此在容量受限,无法完全拟合大模型
Explore this link on the map →