跳到正文
热点事件持续更新

Epoch AI发布InnovationEval评测早期结果

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

Epoch AI 推出 InnovationEval 端到端 AI R&D 自动化能力评测,测试 Claude Fable 5 与 GPT-5.6 Sol 能否独立完成 ML 任务。早期结果显示,两款模型均能独立复现一篇 on-policy self-distillation 论文。 评测每轮算力预算为 3,000 GPU 小时,最多使用 50 块 GPU,约为每个任务完整训练所需算力的 10 倍。Epoch AI 表示,后续将对更新模型持续进行记忆性测试并对结果加注,同时根据需要设计新任务以更新评测。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月10日
  1. Hacker News精选
    AI 能否自动化 AI R&D?Epoch AI 推出 InnovationEval 评测

    Epoch AI 的 InnovationEval 让 Claude Fable 5 与 GPT-5.6 Sol 在端到端 ML 任务中独立复现 on-policy self-distillation 论文。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。