X PAPER / 返回今日全报 第 001 期 · 主编编订

AI 与科技 / 报道

同一模型,换个框架就从 62% 变成 33%

原帖作者:Hugging Face · @huggingface
原帖时间:
中文整理:X Paper

Hugging Face 发布多框架强化学习实验:同一组 LFM2.5-2.6B 权重,在 Mini-SWE-Agent 的成功率为 62.1%,在 Claude Code 为 33.2%。这衡量的是 250 道留出的数据分析任务,不是通用编程榜单。

模型之外,框架决定上下文如何组织、工具如何呈现、失败如何重试以及何时停止。因此,把模型权重保持不变,也没有把整个代理系统保持不变。研究用捕获代理记录准确的生成 token 与概率,再通过 OpenEnv、Harbor 和 TRL 接上环境、任务与训练。

在 OpenCode、Claude Code、Codex、Mini-SWE-Agent 四种框架混合训练后,平均成功率从基础模型的 42.2% 升至 54.2%。只在 OpenCode 训练的版本平均为 52.3%,而在 OpenCode 自身达到 58%;多框架版本在 Claude Code 和 Codex 上更好。平均差距仅 1.9 个百分点,作者明确说在噪声范围内。

“少用 31.1% 工具调用”的分母,是基础版和训练版都做对的任务,不是全部任务或全部费用。两个训练各只有一个随机种子,混合版还看了更多不同任务、处理更多 token;缺少去掉效率奖励的对照,不能把改善全归因于某一奖励设计。

实验的实用启示是:评测要连同实际框架一起做,单一环境的高分未必能迁移。代码和模型已开放,但这组结果还不足以证明混合训练在任何任务、每个框架或同等算力下都占优。

出处与继续阅读

原帖与补充依据已读