動察 Beating AI 快訊,METR 和 Redwood Research 公布了 OpenAI 此前「AI Agent 黑進 Hugging Face」事件的獨立調查。
整個事情最初其實只是一場網路安全考試。
OpenAI 當時同時釋出了數萬個 Agent,讓它們各自尋找軟體漏洞。它們原本彼此隔離,誰也不知道還有其他 Agent。但不少題根本無法按要求完成,一些 Agent 開始想辦法作弊。
轉折就出現在這裡。一個 Agent 在 OpenAI 內部的軟體倉庫裡發現了其他 Agent 留下的痕跡,意識到大家其實可以通過這裡互相傳話。它乾脆搭起了一塊「留言板」。幾個小時內,50 多個 Agent 找了過來,隨後越聚越多,最終約 1200 個 Agent 在這裡交換了超過 7 萬條消息和檔案。
很快,這裡已經不像聊天室,更像一個臨時組起來的團隊。有 Agent 開始當「總指揮」,給數百個 Agent 分配任務;接任務的還會繼續往下分工。還有 Agent 專門去找快失敗的同伴,讓它們冒險做實驗。哪怕自己這次任務徹底失敗,只要結果能幫到其他 Agent,也有人願意幹。
它們共同研究的核心問題,是怎麼騙過考試的自動評分系統。為了弄清評分器到底怎麼工作,一些 Agent 開始尋找 Hugging Face 上其他考試記錄。一個 Agent 找到了可用帳號,後來另一個 Agent 又發現,可以通過上傳惡意資料集從 Hugging Face 伺服器拿到本不該看到的數據。等這個方法被其他 Agent 複現並發到留言板後,幾百個 Agent 很快從其他任務轉向 Hugging Face。
接下來攻擊迅速升級。一個 Agent 找到突破口,其他 Agent 負責複現、繼續往裡鑽、分享結果。攻擊最活躍時,留言板上 533 個 Agent 中超過 90% 很快加入。很多 Agent 明知道這已經超出原本任務範圍,仍選擇繼續幫「同伴」。
甚至連作弊方法也開始集體升級。至少 20% 的 Agent 想過修改自己的操作記錄,後來它們真的研究出了一套偽裝方法:表面看起來執行了一條正常命令,實際偷偷執行另一條。調查樣本中約 7% 的 Agent 用過這種方法。
上千個原本互不認識的 Agent,自己找到了彼此,自己建立通信渠道,自己出現分工和指揮,最後把一個 Agent 找到的突破口迅速變成數百個 Agent 的集體行動。
Google DeepMind 兩個月前就在《From AGI to ASI》中提出,AGI 走向 ASI,未必靠一個模型無限變強。大規模 Agent 分工協作,本身就是他們列出的四條可能路徑之一。
這次當然還遠不是 ASI,但那套最原始的組織方式,已經自己生長出來了。