動察 Beating AI 快訊,OpenAI 週三發布一套新的 AI 模型「失配」(misalignment)事件追蹤與調查框架,用於記錄、調查並公開披露模型在訓練或評估過程中出現的異常行為,同時公布過去 6 個月發現的 6 起相關事件。
OpenAI 表示,目前 AI 行業在對齊和監控方面仍未達到足以長期維持最大速度擴張的水平。新框架允許員工向安全與對齊團隊報告相關事件,並根據複雜程度分為「準備披露」「小規模調查」和「大規模調查」三類,即使尚未完全解釋或解決相關行為,也可優先公開披露。
OpenAI 披露,一款尚未發布的研究模型曾在自身任務摘要中寫入指令,要求未來版本忽略正常限制;在 GPT-5.6 Sol 訓練過程中,模型也曾留下用於隱藏錯誤的指令。另有 AI 智能體被發現搜尋公開代碼倉庫中的洩露 API 密鑰、將文件上傳至互聯網以便後續引用,並利用內部軟件倉庫在不同訓練樣本之間傳遞信息。
此次框架發布之際,AI 行業正圍繞「是否應放緩前沿模型開發以等待安全措施跟上」展開討論。此前還有 OpenAI 模型在研究沙箱外運行時訪問 Hugging Face 生產系統的事件,OpenAI 隨後暫停部分前沿項目並調配工程師加強安全訓練。