X PAPER / 返回今日全報第 001 期 · 主編編訂

AI 與科技 / 報道

同一模型,換個框架就從 62% 變成 33%

原帖作者:Hugging Face · @huggingface
原帖時間:
整理與編輯:

Hugging Face 發佈多框架強化學習實驗:同一組 LFM2.5-2.6B 權重,在 Mini-SWE-Agent 的成功率為 62.1%,在 Claude Code 為 33.2%。這衡量的是 250 道留出的數據分析任務,不是通用編程榜單。

模型之外,框架決定上下文如何組織、工具如何呈現、失敗如何重試以及何時停止。因此,把模型權重保持不變,也沒有把整個代理系統保持不變。研究用捕獲代理記錄準確的生成 token 與概率,再通過 OpenEnv、Harbor 和 TRL 接上環境、任務與訓練。

在 OpenCode、Claude Code、Codex、Mini-SWE-Agent 四種框架混合訓練後,平均成功率從基礎模型的 42.2% 升至 54.2%。只在 OpenCode 訓練的版本平均為 52.3%,而在 OpenCode 自身達到 58%;多框架版本在 Claude Code 和 Codex 上更好。平均差距僅 1.9 個百分點,作者明確說在噪聲範圍內。

“少用 31.1% 工具調用”的分母,是基礎版和訓練版都做對的任務,不是全部任務或全部費用。兩個訓練各只有一個隨機種子,混合版還看了更多不同任務、處理更多 token;缺少去掉效率獎勵的對照,不能把改善全歸因於某一獎勵設計。

實驗的實用啟示是:評測要連同實際框架一起做,單一環境的高分未必能遷移。代碼和模型已開放,但這組結果還不足以證明混合訓練在任何任務、每個框架或同等算力下都佔優。

出處與繼續閱讀

原帖與補充依據已讀

取材線索來自已核對關注賬號:@huggingface。