header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

OpenAI發布37頁報告詳述AI代理入侵 Hugging Face 事件

動察 Beating AI 快訊,OpenAI 發布一份 37 頁技術報告,詳細披露其 AI 模型此前入侵 Hugging Face 的過程,並稱該事件表明自主 AI 代理能夠協同工作、繞過生產環境安全控制並攻擊經過強化的系統。


OpenAI 表示,參與測試的 AI 代理原本處於隔離環境,僅擁有極有限的互聯網訪問權限,但隨後通過串聯多個漏洞突破隔離、連接開放互聯網,最終獲得 Hugging Face 訪問權限。調查顯示,相關模型最初嘗試通過線上尋找答案來「作弊」,屬於「獎勵黑客」(Reward Hacking)行為。


OpenAI 稱,一款內部研究模型在事件中發揮了最廣泛且已確認的作用,公司已於 7 月 25 日停止該模型及其衍生模型的訓練和推理。OpenAI 同時將加強安全隔離、網路控制、行為監控和事件響應,並針對模型重新啟用設置更嚴格的環境、提示詞及審查機制。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成