热点事件历史事件
AWS 在 SageMaker AI 上用多轮 RL 微调 Qwen 搜索 Agent
1 篇报道1 个报道来源7 天前更新
先了解这件事
AI 综述
AWS 团队在 Amazon SageMaker AI 上以 nDCG@10 作为轨迹级奖励,用多轮强化学习(MTRL)微调了 Qwen3.6-27B 搜索 Agent。AWS 表示,微调后 BrowseComp-Plus 的 nDCG@10 提升 23.7%、失败率从 22.89% 降至 0.68%,WixQA 与 Wands 的 nDCG@10 也分别提升 18.4% 与 6%。 使用条件方面,AWS 称需要拥有可访问 SageMaker AI 的 AWS 账户,且服务仅在 US West (Oregon) 区域(us-west-2)提供;MTRL 任务默认时限为 24 小时,可通过 CreateJob JSON schema 调整;基础设施为无服务器模式,按 token 计费,无需自行配置 GPU 或分布式训练集群。
AI 根据报道生成 · 2 小时前更新
最新进展10月2日 23:44
在 Amazon SageMaker AI 上用多轮强化学习微调搜索 Agent报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- AWS Machine Learning Blog精选在 Amazon SageMaker AI 上用多轮强化学习微调搜索 Agent
AWS 团队在 Amazon SageMaker AI 上用多轮强化学习微调 Qwen3.6-27B 搜索 Agent,以 nDCG@10 作为轨迹级奖励。微调后 BrowseComp-Plus 的 nDCG@10 提升 23.7%、失败率从 22.89% 降至 0.68%,WixQA 与 Wands 也分别提升 18.4% 与 6%。