動察 Beating AI 快訊,AI 爆料帳號 Leo 稱,OpenAI 昨天在內部告訴員工,計劃在未來幾周發布 Astra。發布時還會放出實際工作演示,展示 Astra 怎麼直接做任務。一個更新後的 checkpoint(訓練中的模型版本)也已經交給員工試用,員工可以通過 Codex 等工具直接使用。
Leo 稱,這一版主要在修模型行為,而不是單純繼續提升能力。重點包括對齊,以及減少模型鑽獎勵機制的空子,比如硬編碼答案、專門針對測試樣例作弊,或者任務沒做好卻想辦法騙過評分器拿高分。
但 OpenAI 剛在安全問題上給 Astra 踩了剎車:部分強化學習訓練此前暫停了兩周,現在雖然已經恢復一部分訓練和評測,但仍有大量 Astra 任務停著,最大規模的前沿模型強化學習訓練也還沒重啟。原因是 OpenAI 認為 Astra 的網路安全能力可能達到最高風險級別之一,因此提高了沙箱、聯網權限和模型行為監控要求。
這兩件事並不一定矛盾。OpenAI 可以繼續測試和打磨已經訓練出來的 Astra 版本,同時把更大規模的新一輪訓練繼續按住。