跳到正文
原文
HF Daily Papers·· 4 天前精选AI 评分35

Naver AI 提出 NP-OPD:在 On-Policy 蒸馏中引入负向策略 Rollouts

On-Policy Distillation with Negative-Policy Rollouts

AI 导读

Naver AI 提出 NP-OPD 方法,在 on-policy 蒸馏(OPD)的 rollout 阶段额外引入一个能力较弱的负向策略作为负参考,与教师监督互补,为学生模型提供显式负向信号,同时保留原有的教师监督。

推荐理由

原文给出在 On-Policy 蒸馏中引入负向策略 rollouts 的具体做法和跨规模实验结果,为改进学生模型蒸馏训练提供了可迁移的负向信号方案。

来源:HF Daily Papers · huggingface.co