热点事件持续更新
Qwen3.8 27B 英文单词加法基准测试
1 篇报道1 个报道来源19 小时前更新
先了解这件事
AI 综述
2026 年 10 月 5 日,Simon Willison 发布了一项针对本地 Qwen3.8-27B-Q4_K_M.gguf 模型的基准测试,检验其能否在禁用推理的情况下,仅用英文单词完成正整数加法并给出精确结果。测试包含 5,070 个案例,数值准确率为 23.57%,格式合规率为 96.17%。准确率随数字位数增加而下降:一至三位数为 97.04%,十至十三位数降至 6.44%。此外,在 169 个启用中等推理的配对案例中,模型答对了 167 个。
AI 根据报道生成 · 1 小时前更新
最新进展10月5日 07:34
测试显示禁用推理时数值准确率仅 23.57%,启用中等推理后 169 例答对 167 例。报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- Simon WillisonQwen3.8 27B 用英文单词做加法的基准测试
一项基准测试用 5,070 个禁用推理的案例检验本地 Qwen3.8-27B-Q4_K_M.gguf 能否只用英文单词完成正整数加法并给出精确结果,其数值准确率为 23.57%,格式合规率 96.17%。准确率随位数增加从一至三位数的 97.04% 降至十至十三位数的 6.44%;另在 169 个启用中等推理的配对案例中答对 167 个。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。