跳到正文
原文
HF Daily Papers·· 4 天前精选AI 评分46

Self-Retrospection Distillation:把事后轨迹经验蒸馏成事前预判

Self-Retrospection Distillation: Turning Post-hoc Experiences into Prior Foresight

AI 导读

该论文提出 Self-Retrospection Distillation(SRD),把已完成轨迹中的事后经验蒸馏为同一策略在交互前的预判,弥补 RLVR 在 rollout 奖励一致时信号消失的缺陷。

推荐理由

该方法在 rollout 组奖励一致、RLVR 失去信号的场景下仍能从轨迹中提取学习信号,为奖励稀疏的长程智能体训练提供可迁移思路。

来源:HF Daily Papers · huggingface.co