HF Daily Papers·· 3 天前精选AI 评分38
SQAM:用标量伴随匹配微调 Flow 策略的 Q 学习方法
Q-Learning with Scalar Adjoint Matching
AI 导读
研究者提出 Q-learning with Scalar Adjoint Matching(SQAM),用闭式标量伴随替代逐步向量-雅可比积,把价值梯度按 flow 时间缩放,从而为 flow 策略做 RL 微调。在 OGBench 最难的 4 个领域,SQAM 的成功率比最强基线高出 18 到 35 个百分点;在真实双臂机器人上微调 VLA 策略时,三个任务也都优于监督微调。
推荐理由
原文给出把 RL 微调 flow 策略的逐步向量-雅可比积换成闭式标量的推导,并报告在真实机器人任务上超过监督微调,可作为该方向后续工作的方法基线。
来源:HF Daily Papers · huggingface.co