On-Policy Distillation 初识
Warning
去递归学习了,待完善、、、
【40分钟了解OPD的主要工作:为什么RL时代还需要On-Policy Distillation】
【研3基本功+1】你难道还没学过 OPD 吗?(On-policy distillation 基础知识)】
OPD 是一个大模型后训练里一个比较经典的范式之一
大模型后训练中常见的技术
- SFT: 模仿学习,使用专家的数据进行微调
- RLVR: 强化学习后训练技术,缺点:奖励稀疏
- OPD: 让模型先生成自己的序列(?)然后再让更强的 teacher 模型给出相应的...
\[
\mathcal{L}_{\text{SFT}} = -\sum_{t=1}^{T} \log p_{\theta}\left(y_{t}^{*} \mid x, y_{<t}^{*}\right)
\]
\[
\mathcal{L}_{OPD} = \mathbb{E}_{x\sim D,\,y\sim\pi_\theta}\left[\sum_{t} D_{\text{KL}}\big(\pi_\tau(\cdot \mid s_t) \parallel \pi_\theta(\cdot \mid s_t)\big)\right]
\]
Tip
强化学习就像没有教练地玩游戏,但每场比赛只收到一次胜利/失败
蒸馏就像观看大师下棋,经管能观察到非常强的棋步,但他们是在新手玩家很少会遇到的棋盘状态下进行的
结合两者的优点,就是On-Policy Distillation,核心是从Student Model中采样轨迹,并使用教师模型对每个token进行评分