根據動撫 Beating 監測,OpenAI 開始主動放慢前沿模型訓練。公司一度暫停部分前沿 RL 訓練兩週,規模最大的幾項到現在還沒恢復。Astra 的不少訓練和評測也還停著。
Hugging Face 入侵只是其中一個原因。OpenAI 同時發現,Astra 的網路攻擊能力可能已經碰到內部定義的「Critical」門檻。這類高風險訓練接下來必須先把隔離、監控和對齊做到更高標準,才能繼續。
奧特曼之前就說過,如果模型能力跑得比安全措施更快,AI 開發就該減速。Hugging Face 事件後,他也稱這是第一次讓自己真切感受到前沿模型的安全風險。隨後超過 1200 名頭部 AI 公司員工聯署,要求行業建立統一的減速機制,其中包括多名 OpenAI 核心研究人員。
現在 OpenAI 自己先踩了剎車。