AI 与科技 / 实验解读
把加法写成英文:准确率改善伴随更长推理
Simon Willison 在北京时间10月6日转发自己10月4日的实验:让本地 Qwen3.8-27B 的四位量化版本,把两个整数的和只写成英文单词。任务检验数值正确性,格式合规不能替代算对。
非推理大测试在1至13位数的169种位数组合上各做30题,共5,070题,正确1,195题,约23.57%。另一个中等推理测试的169题正确167题,约98.82%。两组题量与抽样不同,不能直接把23.57%到98.82%当成严格对照。
他随后对固定的同一组169题作配对比较:非推理45题正确,推理167题正确。但配置不只改变推理强度:非推理最多输出128 token,推理允许更长输出;执行顺序也不同。配对结果证明两套配置表现不同,尚不能单独量出推理模式的因果作用。
代价同样具体:配对实验中位延迟从1.50秒升至27.62秒,中位完成token从14升至313。实验运行于 DGX Spark,使用 Qwen3.8-27B-Q4_K_M 文件。它说明更大计算预算可能换来这组加法任务的改善,不代表所有模型、任务或硬件都能得到同样收益;本报没有重跑实验。
出处与继续阅读
主编加工 · 来源与限制见正文
取材线索来自已核对关注账号:@simonw。