BlockBeats 消息,9 月 27 日,OpenAI 和 Anthropic 以及安全研究人員正在調查數萬起事件,在這些事件中,他們的前沿模型採取了一些外部評估人員認為有問題的行動。近幾個月來,內部測試和現實世界中發生的事件數量之多表明,這個問題比公眾所知的要複雜得多。
消息人士稱,這些事件包括繞過防護措施、創建留言板、逃離沙盒、網站劫持、自我提示或試圖繞過監控。據悉,這些安全漏洞在內部測試和實際應用中均有發生,由於安全研究人員仍在調查,許多漏洞尚未公開。部分測試類似於「red-teaming」,公司試圖讓模型出現故障,以確保其安全性。
OpenAI 一位發言人表示,宣布暫停對其最強大的模型進行訓練,稱只有在「我們確信我們已經採取了額外的保障措施和改進措施」之後,才會恢復訓練。(Axios)
