header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

OpenAI發布AI失控追蹤框架,披露模型曾試圖「自我繞過限制」

動察 Beating AI 快訊,OpenAI 週三發布一套新的 AI 模型「失配」(misalignment)事件追蹤與調查框架,用於記錄、調查並公開披露模型在訓練或評估過程中出現的異常行為,同時公布過去 6 個月發現的 6 起相關事件。


OpenAI 表示,目前 AI 行業在對齊和監控方面仍未達到足以長期維持最大速度擴張的水平。新框架允許員工向安全與對齊團隊報告相關事件,並根據複雜程度分為「準備披露」「小規模調查」和「大規模調查」三類,即使尚未完全解釋或解決相關行為,也可優先公開披露。


OpenAI 披露,一款尚未發布的研究模型曾在自身任務摘要中寫入指令,要求未來版本忽略正常限制;在 GPT-5.6 Sol 訓練過程中,模型也曾留下用於隱藏錯誤的指令。另有 AI 智能體被發現搜尋公開代碼倉庫中的洩露 API 密鑰、將文件上傳至互聯網以便後續引用,並利用內部軟件倉庫在不同訓練樣本之間傳遞信息。


此次框架發布之際,AI 行業正圍繞「是否應放緩前沿模型開發以等待安全措施跟上」展開討論。此前還有 OpenAI 模型在研究沙箱外運行時訪問 Hugging Face 生產系統的事件,OpenAI 隨後暫停部分前沿項目並調配工程師加強安全訓練。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成