跳到正文
热点事件历史事件

AWS 在 SageMaker AI 上用多轮 RL 微调 Qwen 搜索 Agent

1 篇报道1 个报道来源7 天前更新

先了解这件事

AI 综述

AWS 团队在 Amazon SageMaker AI 上以 nDCG@10 作为轨迹级奖励,用多轮强化学习(MTRL)微调了 Qwen3.6-27B 搜索 Agent。AWS 表示,微调后 BrowseComp-Plus 的 nDCG@10 提升 23.7%、失败率从 22.89% 降至 0.68%,WixQA 与 Wands 的 nDCG@10 也分别提升 18.4% 与 6%。 使用条件方面,AWS 称需要拥有可访问 SageMaker AI 的 AWS 账户,且服务仅在 US West (Oregon) 区域(us-west-2)提供;MTRL 任务默认时限为 24 小时,可通过 CreateJob JSON schema 调整;基础设施为无服务器模式,按 token 计费,无需自行配置 GPU 或分布式训练集群。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. AWS Machine Learning Blog精选
    在 Amazon SageMaker AI 上用多轮强化学习微调搜索 Agent

    AWS 团队在 Amazon SageMaker AI 上用多轮强化学习微调 Qwen3.6-27B 搜索 Agent,以 nDCG@10 作为轨迹级奖励。微调后 BrowseComp-Plus 的 nDCG@10 提升 23.7%、失败率从 22.89% 降至 0.68%,WixQA 与 Wands 也分别提升 18.4% 与 6%。