热点事件持续更新
Qwen3.8 27B 英文加法输出基准测试结果
1 篇报道1 个报道来源19 小时前更新
先了解这件事
AI 综述
2026 年 10 月 5 日,Simon Willison 发布了对 Qwen3.8 27B 模型用英文单词表达加法结果的基准测试结果。测试使用 Qwen3.8-27B-Q4_K_M.gguf 模型,在 DGX Spark 本地硬件上完成,灵感来自两年前用 GPT-4o 做的同类实验。测试分为两个阶段:在禁用推理模式时,模型在 5,070 道加法题中仅 23.57% 能用英文单词正确输出结果;按位数细分,对 1-3 位数的正确率高达 97.04%,但对 10-13 位数的正确率骤降至 6.44%,显示出随位数增加表现的急剧退化。启用中等推理模式后,模型在 169 道对比题中答对 167 题,正确率显著提升,表明推理能力对完成此类英文输出任务有关键作用。
AI 根据报道生成 · 2 小时前更新
最新进展10月5日 07:34
禁用推理时该模型英文加法输出正确率仅 23.57%,启用推理后 169 道对比题答对 167 道。报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- Simon WillisonQwen3.8 27B 模型加法结果用英文单词表达的基准测试
禁用推理时,Qwen3.8-27B-Q4_K_M.gguf 在 5,070 道加法题中仅 23.57% 能用英文单词正确输出结果,对 10-13 位数正确率从 1-3 位的 97.04% 跌至 6.44%;启用中等推理后,169 道对比题答对 167 题。该测试在 DGX Spark 本地硬件上完成,灵感来自两年前用 GPT-4o 做的同类实验。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。