AI 與科技 / 實驗解讀
把加法寫成英文:準確率改善伴隨更長推理
Simon Willison 在北京時間10月6日轉發自己10月4日的實驗:讓本地 Qwen3.8-27B 的四位量化版本,把兩個整數的和只寫成英文單詞。任務檢驗數值正確性,格式合規不能替代算對。
非推理大測試在1至13位數的169種位數組合上各做30題,共5,070題,正確1,195題,約23.57%。另一箇中等推理測試的169題正確167題,約98.82%。兩組題量與抽樣不同,不能直接把23.57%到98.82%當成嚴格對照。
他隨後對固定的同一組169題作配對比較:非推理45題正確,推理167題正確。但配置不只改變推理強度:非推理最多輸出128 token,推理允許更長輸出;執行順序也不同。配對結果證明兩套配置表現不同,尚不能單獨量出推理模式的因果作用。
代價同樣具體:配對實驗中位延遲從1.50秒升至27.62秒,中位完成token從14升至313。實驗運行於 DGX Spark,使用 Qwen3.8-27B-Q4_K_M 文件。它說明更大計算預算可能換來這組加法任務的改善,不代表所有模型、任務或硬件都能得到同樣收益;本報沒有重跑實驗。
出處與繼續閱讀
主編加工 · 來源與限制見正文
取材線索來自已核對關注賬號:@simonw。