热点事件持续更新
Epoch AI发布InnovationEval评测早期结果
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
Epoch AI 推出 InnovationEval 端到端 AI R&D 自动化能力评测,测试 Claude Fable 5 与 GPT-5.6 Sol 能否独立完成 ML 任务。早期结果显示,两款模型均能独立复现一篇 on-policy self-distillation 论文。 评测每轮算力预算为 3,000 GPU 小时,最多使用 50 块 GPU,约为每个任务完整训练所需算力的 10 倍。Epoch AI 表示,后续将对更新模型持续进行记忆性测试并对结果加注,同时根据需要设计新任务以更新评测。
AI 根据报道生成 · 2 小时前更新
最新进展10月10日 06:14
AI 能否自动化 AI R&D?Epoch AI 推出 InnovationEval 评测报道时间线
沿着报道,了解事件的不同侧面。
10月10日
- Hacker News精选AI 能否自动化 AI R&D?Epoch AI 推出 InnovationEval 评测
Epoch AI 的 InnovationEval 让 Claude Fable 5 与 GPT-5.6 Sol 在端到端 ML 任务中独立复现 on-policy self-distillation 论文。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。