HF Daily Papers·· 1 天前AI 评分39
VeriFine:在具身推理中扩展验证以实现自我改进
VeriFine: Scaling Verification for Self-Improvement in Embodied Reasoning
AI 导读
VeriFine 提出一种面向具身推理的智能体框架,通过策略、训练课程与评审器的协同演化扩展验证能力。其策略改进循环借助评分式评审器诊断反复出现的失败并构建自适应课程;当验证成为瓶颈时,评审改进循环会在高价值失败样本上查询人类反馈并进行协同校准。在驾驶和机器人导航任务上的实验显示,策略与评审器能力在强化学习与监督微调下均能持续自我提升。
来源:HF Daily Papers · huggingface.co