跳到正文
热点事件持续更新

Simon Willison 评测 Qwen3.8 27B 模型纯文字加法输出能力

1 篇报道1 个报道来源19 小时前更新

先了解这件事

AI 综述

2026年10月5日,Simon Willison 发布了一项基准测试结果,评估了本地 `Qwen3.8-27B-Q4_K_M.gguf` 模型仅使用英文单词完成正整数加法并输出精确结果的能力。在禁用推理的5,070个测试案例中,模型的数字准确率为23.57%。其性能随操作数位数增加而显著下降,从一位至三位数的97.04%骤降至十至十三位数的6.44%。在启用推理的169个对比案例中,模型取得了167个正确结果。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. Simon Willison
    Qwen3.8 27B 模型在纯文字加法任务中的表现评测

    一项基准测试评估了本地 `Qwen3.8-27B-Q4_K_M.gguf` 模型仅用英文单词完成正整数加法并输出精确结果的能力。在禁用推理的 5,070 个案例中,其数字准确率为 23.57%,且随着操作数位数增加,性能从一位至三位数的 97.04% 骤降至十至十三位数的 6.44%。启用推理后,模型在 169 个对比案例中取得了 167 个正确结果。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。