HF Daily Papers·· 4 天前精选AI 评分35
Naver AI 提出 NP-OPD:在 On-Policy 蒸馏中引入负向策略 Rollouts
On-Policy Distillation with Negative-Policy Rollouts
AI 导读
Naver AI 提出 NP-OPD 方法,在 on-policy 蒸馏(OPD)的 rollout 阶段额外引入一个能力较弱的负向策略作为负参考,与教师监督互补,为学生模型提供显式负向信号,同时保留原有的教师监督。
推荐理由
原文给出在 On-Policy 蒸馏中引入负向策略 rollouts 的具体做法和跨规模实验结果,为改进学生模型蒸馏训练提供了可迁移的负向信号方案。
来源:HF Daily Papers · huggingface.co