跳到正文
热点事件持续更新

Qwen3.8 27B 英文加法输出基准测试结果

1 篇报道1 个报道来源19 小时前更新

先了解这件事

AI 综述

2026 年 10 月 5 日,Simon Willison 发布了对 Qwen3.8 27B 模型用英文单词表达加法结果的基准测试结果。测试使用 Qwen3.8-27B-Q4_K_M.gguf 模型,在 DGX Spark 本地硬件上完成,灵感来自两年前用 GPT-4o 做的同类实验。测试分为两个阶段:在禁用推理模式时,模型在 5,070 道加法题中仅 23.57% 能用英文单词正确输出结果;按位数细分,对 1-3 位数的正确率高达 97.04%,但对 10-13 位数的正确率骤降至 6.44%,显示出随位数增加表现的急剧退化。启用中等推理模式后,模型在 169 道对比题中答对 167 题,正确率显著提升,表明推理能力对完成此类英文输出任务有关键作用。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. Simon Willison
    Qwen3.8 27B 模型加法结果用英文单词表达的基准测试

    禁用推理时,Qwen3.8-27B-Q4_K_M.gguf 在 5,070 道加法题中仅 23.57% 能用英文单词正确输出结果,对 10-13 位数正确率从 1-3 位的 97.04% 跌至 6.44%;启用中等推理后,169 道对比题答对 167 题。该测试在 DGX Spark 本地硬件上完成,灵感来自两年前用 GPT-4o 做的同类实验。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。