HF Daily Papers·· 3 天前AI 评分46
OPPD:无需搜索的序列级幂分布 on-policy 蒸馏
Sharpen Without Search: On-Policy Distillation of Sequence-Level Power Distribution
AI 导读
OPPD(On-Policy Power Distillation)通过序列蒙特卡洛采样器,以冻结教师模型的幂分布为候选加权并做最大似然训练,让模型一次生成即输出"锐化"答案。
来源:HF Daily Papers · huggingface.co