header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

又一條RSI路線出現:模型參數不動,Agent靠Memory持續進化

動察 Beating AI 快訊,UCSD 助理教授黃碧薇創辦的因果世界模型公司 Aether AI 開源 RSIAgent。


這是一套不訓練模型的遞迴自我改進框架。底層模型參數全程固定,Agent 會自己尋找值得練習的任務、實際操作、檢查結果,再把成功方法和失敗教訓寫進長期 Memory。下一輪繼續利用這些經驗,逐步補上能力短板。


系統由三個 Agent 配合。Curriculum Agent 決定接下來練什麼,Actor Agent 真正操作軟體,Verifier Agent 獨立檢查結果。探索分成兩步:先廣泛嘗試不同任務,再針對失敗、隱藏限制和邊界情況繼續深挖。最後 Memory 會被凍結,直接拿去執行正式任務。


在 OSWorld 2.0 上,加入這套 RSI 後,平均部分得分從 71.97% 提升到 78.98%;Agents’ Last Exam 從 83.75% 提升到 84.82%。不過這不是整套測試的嚴格 A/B 對比。OSWorld 只有一半任務實際用了 RSI 後的新結果,其餘任務繼續沿用原成績。


它和 Prime Agent 這類 Harness 自我改進思路屬於同一個大方向:模型權重不變,持續更新模型外面的東西。 RSIAgent 的特點是把改進重點放在 Memory,再用自主出題和獨立驗證,讓這份外部經驗庫不斷累積。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成