跳到正文
原文
HF Daily Papers·· 3 天前AI 评分46

OPPD:无需搜索的序列级幂分布 on-policy 蒸馏

Sharpen Without Search: On-Policy Distillation of Sequence-Level Power Distribution

AI 导读

OPPD(On-Policy Power Distillation)通过序列蒙特卡洛采样器,以冻结教师模型的幂分布为候选加权并做最大似然训练,让模型一次生成即输出"锐化"答案。

来源:HF Daily Papers · huggingface.co