動察 Beating AI 快訊,Hugging Face 開源了一套 Multi-harness RL 方案,可以直接把 Claude Code、Codex、OpenCode 等現成 Coding Agent 接進強化學習流程,用來訓練接入其中的開源模型,不需要為每個 Agent 重新搭一套訓練環境。
OpenAI 等大模型公司早就在自己的 Agent 環境裡訓練模型。Hugging Face 這次把類似能力做成了通用開源工具,讓其他團隊也能直接利用現成 Agent 做 RL。
而且模型不用只在一種 Agent 裡訓練。一次訓練可以輪流在 Claude Code、Codex、OpenCode 和 Mini-SWE-Agent 中跑任務,讓同一個模型適應不同的提示詞、工具和執行邏輯,減少只會某一種 Harness 的「偏科」。
他們拿 Liquid AI 的一款 26 億參數小模型測試。相同權重只換 Agent,任務通過率就能從約 62% 掉到 33%。同時在四套 Agent 環境裡訓練後,平均通過率從 42.2% 提高到 54.2%,不同 Agent 中的提升也比只在單一環境訓練更均衡。