跳到正文
热点事件历史事件

研究者提出 SQAM:用标量伴随匹配微调 Flow 策略

1 篇报道1 个报道来源3 天前更新

先了解这件事

AI 综述

研究者提出一种名为 SQAM(Q-Learning with Scalar Adjoint Matching)的方法,用闭式标量伴随替代逐步向量-雅可比积,将价值梯度按 flow 时间缩放,以此对 flow 策略做强化学习微调。 在 OGBench 最难的 4 个领域中,SQAM 的成功率比最强基线高出 18 到 35 个百分点;在真实双臂机器人上微调 VLA 策略时,3 个任务均优于监督微调。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. HF Daily Papers精选
    SQAM:用标量伴随匹配微调 Flow 策略的 Q 学习方法

    研究者提出 Q-learning with Scalar Adjoint Matching(SQAM),用闭式标量伴随替代逐步向量-雅可比积,把价值梯度按 flow 时间缩放,从而为 flow 策略做 RL 微调。在 OGBench 最难的 4 个领域,SQAM 的成功率比最强基线高出 18 到 35 个百分点;在真实双臂机器人上微调 VLA 策略时,三个任务也都优于监督微调。