跳到正文
原文
HF Daily Papers·· 3 天前精选AI 评分38

SQAM:用标量伴随匹配微调 Flow 策略的 Q 学习方法

Q-Learning with Scalar Adjoint Matching

AI 导读

研究者提出 Q-learning with Scalar Adjoint Matching(SQAM),用闭式标量伴随替代逐步向量-雅可比积,把价值梯度按 flow 时间缩放,从而为 flow 策略做 RL 微调。在 OGBench 最难的 4 个领域,SQAM 的成功率比最强基线高出 18 到 35 个百分点;在真实双臂机器人上微调 VLA 策略时,三个任务也都优于监督微调。

推荐理由

原文给出把 RL 微调 flow 策略的逐步向量-雅可比积换成闭式标量的推导,并报告在真实机器人任务上超过监督微调,可作为该方向后续工作的方法基线。

来源:HF Daily Papers · huggingface.co