HF Daily Papers·· 2 天前精选AI 评分43
MiMo-V2.6:扩展强化学习算力推动模型自我提升
MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement
AI 导读
MiMo-V2.6 是一个面向自我提升的全模态模型系列,沿三条维度扩展强化学习算力:在最长 1M 上下文下,每步处理 1,568 样本、2.7-3.7B token 的异步训练;覆盖代码、通用、视觉和赛博领域的智能体环境;以及通过分组智能体评分提供更长链任务奖励信号。为稳定训练,论文还冻结 MoE 路由器并建立多层防奖励作弊机制,并开源训练动态、RL 环境和 RL 框架。
推荐理由
报告给出了训练算力、采样与环境三维度扩展的具体数字与稳定策略,并开源训练动态与框架,可作为大规模 RL 训练的参考路径。
来源:HF Daily Papers · huggingface.co