HF Daily Papers·· 7 天前精选AI 评分37
R-Quest:用问题有效性与新颖性反馈维持推理模型自进化
Questioning the Questions: Sustaining Self-Evolution in Reasoning Models
AI 导读
该工作提出 R-Quest,通过问题有效性判断和基于冻结基模型的成对新颖性反馈来指导自进化训练,在数学推理、通用推理与代码生成的 12 个基准上取得最高平均分,覆盖两种模型家族;该方法在 10 轮自进化中保持稳定提升,最终一轮比 R-Zero 高 17.32 分。
推荐理由
论文拆解了自进化推理模型训练崩塌的两个机制原因,并给出可迁移的问题过滤与新颖性反馈方案,对自训练稳定性设计有参考价值。
来源:HF Daily Papers · huggingface.co