跳到正文
热点事件历史事件

论文提出OPPD方法提升语言模型单次生成推理准确率

1 篇报道1 个报道来源3 天前更新

先了解这件事

报道摘要

OPPD(On-Policy Power Distillation)通过序列蒙特卡洛采样器,以冻结教师模型的幂分布为候选加权并做最大似然训练,让模型一次生成即输出"锐化"答案。

摘自 HF Daily Papers

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. HF Daily Papers
    OPPD:无需搜索的序列级幂分布 on-policy 蒸馏

    OPPD(On-Policy Power Distillation)通过序列蒙特卡洛采样器,以冻结教师模型的幂分布为候选加权并做最大似然训练,让模型一次生成即输出"锐化"答案。