header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

RSIGym開源:讓AI研究如何改進AI,瞄準遞迴自我改進

動察 Beating AI 快訊,做 AI 訓練和評測工具的 Evolvent AI 開源了 RSIGym,目標是研究 AI 的遞迴自我改進(RSI)。簡單說,就是讓 AI 自己尋找系統弱點、提出修改方案、測試效果,再嘗試用改進後的系統開展下一輪研究。


RSIGym 將訓練、推理、評測和沙箱做成現成服務。研究 Agent 可以生成訓練數據、調整微調參數、訓練模型,再根據評測結果修改方案。它還能修改 Harness,也就是控制模型如何調用工具、執行任務的程序。研究者可以讓 Agent 只改訓練數據、只改 Harness,或者同時優化兩者。平台統一管理實驗預算、權限和執行日誌。


團隊還推出 RSI-Index,測試 AI Agent 改進另一套 AI 系統的能力。6 款研究 Agent 分別從相同的 Qwen3.5 基礎模型和簡單 Harness 出發,在編程、數學等 5 類任務上進行優化。Opus 5 綜合排名第一。它改造後的系統在 SWE-bench Verified 的 100 題子集上,成績從 17.67% 提高到 50.33%;數學測試 AIME 則從 31.67% 提高到 97.78%。


另一組實驗只改 Harness,不動模型權重。Opus 5 根據 DeepSeek Harness 的執行日誌,修復了輸出截斷後停止工作、提前宣布任務完成等問題。在 Qwen3.6 模型權重完全不變的情況下,Terminal-Bench 2.0 成績從 30.34% 提高到 40.82%。


團隊還嘗試讓 Qwen3.8-27B 改進自身,由它同時擔任研究 Agent 和被改進的模型。它在 6 道測試題上找到了一套看起來有效的微調方案,但在完整的 37 道題中,成績反而從 56.66% 略降至 56.26%。此外,每組實驗只進行一次研究運行,Agent 在開發階段也能接觸評測題目。目前還沒有證據表明,改進後的 AI 可以繼續提升自身的研發能力,實現多輪遞迴自我改進。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成