header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

AI複盤複廢了:GPT-5.4把題目滿分解法記到只剩54%

据动察 Beating 监测,伊利诺伊大学计算机科学博士生 Dylan Zhang 做了一组 Agent 记忆实验,结果指向一个反常结论:让模型反复总结经验,可能会让它越记越差。

最刺眼的一组结果来自 ARC-AGI:研究者挑出 19 道 GPT-5.4 在无记憶狀態下能全部做對的題,再把這些題的真實解法餵給模型,讓它邊看邊寫「經驗總結」。按理說,這相當於開卷複習;結果經過多輪記憶壓縮後,同一模型的準確率從 100% 跌到 54%。原始軌跡沒有錯,真正出問題的是模型把正確軌跡改寫成通用經驗的那一步。

更壞的是,這種記憶退化不是個例。在 WebShop 網購任務裡,AWM 記憶方法吃進 8 條專家軌跡時得分還有 0.64,軌跡增加到 128 條後跌到 0.20,剛好回到無記憶基線。也就是說,記憶越堆越厚,收益反而被自己抹平。

問題不在「經驗太少」,而在「總結太勤」。大模型寫下的經驗並不是客觀日誌,每次總結都是一次重新生成。寫到最後,具體前提會被刪掉,不同任務的規則會被揉在一起,原本能指導操作的細節會變成「優先採取最直接行動」「使用正確工具」這類看似正確、實際沒用的廢話。原文展示的一個極端例子是,50 條結構化記憶被一次合併成 1 條,多個任務差異被壓成同一個通用流程,下一輪評估直接丟掉 6 到 13 個成功樣本。

作者給出的建議很克制:別急著讓 Agent 每輪都寫「錯題本」。更穩的做法是保留經過篩選的原始操作軌跡,只在確實需要時再抽象總結。實驗裡,只保留原始 episode、關閉抽象總結的方案,在多個 Agent 基準上追平或超過了測試過的壓縮式記憶方法。對開發者來說,這條結論很直接:給模型看真實做過什麼,通常比讓它背一堆抽象規則更有用。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成