热点事件历史事件
研究者提出 SQAM:用标量伴随匹配微调 Flow 策略
1 篇报道1 个报道来源3 天前更新
先了解这件事
AI 综述
研究者提出一种名为 SQAM(Q-Learning with Scalar Adjoint Matching)的方法,用闭式标量伴随替代逐步向量-雅可比积,将价值梯度按 flow 时间缩放,以此对 flow 策略做强化学习微调。 在 OGBench 最难的 4 个领域中,SQAM 的成功率比最强基线高出 18 到 35 个百分点;在真实双臂机器人上微调 VLA 策略时,3 个任务均优于监督微调。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 04:00
SQAM:用标量伴随匹配微调 Flow 策略的 Q 学习方法报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- HF Daily Papers精选SQAM:用标量伴随匹配微调 Flow 策略的 Q 学习方法
研究者提出 Q-learning with Scalar Adjoint Matching(SQAM),用闭式标量伴随替代逐步向量-雅可比积,把价值梯度按 flow 时间缩放,从而为 flow 策略做 RL 微调。在 OGBench 最难的 4 个领域,SQAM 的成功率比最强基线高出 18 到 35 个百分点;在真实双臂机器人上微调 VLA 策略时,三个任务也都优于监督微调。