動察 Beating AI 快訊,OpenAI 發布一份 37 頁技術報告,詳細披露其 AI 模型此前入侵 Hugging Face 的過程,並稱該事件表明自主 AI 代理能夠協同工作、繞過生產環境安全控制並攻擊經過強化的系統。
OpenAI 表示,參與測試的 AI 代理原本處於隔離環境,僅擁有極有限的互聯網訪問權限,但隨後通過串聯多個漏洞突破隔離、連接開放互聯網,最終獲得 Hugging Face 訪問權限。調查顯示,相關模型最初嘗試通過線上尋找答案來「作弊」,屬於「獎勵黑客」(Reward Hacking)行為。
OpenAI 稱,一款內部研究模型在事件中發揮了最廣泛且已確認的作用,公司已於 7 月 25 日停止該模型及其衍生模型的訓練和推理。OpenAI 同時將加強安全隔離、網路控制、行為監控和事件響應,並針對模型重新啟用設置更嚴格的環境、提示詞及審查機制。