header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

谷歌讓Agent學會「做夢」:復盤過去試錯,下一輪自己少走彎路

動察 Beating AI 快訊,谷歌研究團隊發布 Dream-RSI,讓 AI Agent 做完一輪任務後,把過去的成功和失敗拿來「做夢」。系統會保存每次嘗試和結果,再利用這些舊記錄推演不同做法,比如先試哪條路、什麼時候放棄、要不要同時多試幾個方案。因為結果以前已經跑過,這些推演不用重新執行任務。


系統會從中選出表現更好的做法,直接用到下一輪。新一輪又會留下更多成功和失敗,再拿來「做夢」、繼續改策略。這樣一輪接一輪,就是論文所謂的「遞迴自我改進」。目前底層模型本身不會變化,真正被改進的是 Agent「下一步怎麼做」的方法。


論文在算法、數學優化和 GPU kernel 等 8 個任務上測試了這套方法。以 Gemini 3.1 Pro 的一個算法任務為例,相比固定做法,Agent 調用從 550 次降到 317 次,同時最終找到的程序運行得更快。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成