跳到正文
热点事件观察中

MiMo-V2.6论文:扩展RL算力推动模型自我提升

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

MiMo-V2.6论文作者发布了一个面向自我提升的全模态模型系列,沿三条维度扩展强化学习算力:在最长 1M token 上下文下进行每步处理 1,568 个样本、2.7–3.7B token 的异步训练;构建覆盖代码、通用、视觉和赛博领域的智能体环境;以及通过分组智能体评分给出更长链任务的奖励信号。 为稳定训练,作者冻结了 MoE 路由器并加入多层防奖励作弊机制。 作者称已将训练动态、RL 环境和 RL 框架开源,以供复现和后续研究使用。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. HF Daily Papers精选
    MiMo-V2.6:扩展强化学习算力推动模型自我提升

    MiMo-V2.6 是一个面向自我提升的全模态模型系列,沿三条维度扩展强化学习算力:在最长 1M 上下文下,每步处理 1,568 样本、2.7-3.7B token 的异步训练;覆盖代码、通用、视觉和赛博领域的智能体环境;以及通过分组智能体评分提供更长链任务奖励信号。为稳定训练,论文还冻结 MoE 路由器并建立多层防奖励作弊机制,并开源训练动态、RL 环境和 RL 框架。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。