動察 Beating AI 快訊,Anthropic 讓 Claude 自己當 AI 安全研究員,研究怎麼把其他 AI 訓練得更安全。
Claude Opus 4.8 會自己查論文、想訓練方案、生成數據,再拿這些方案去訓練 Qwen、Llama、Gemma 等開源模型。效果不好,它就換一種方法繼續試。
Anthropic 用這種方式測試了 10 類 AI 安全問題,包括說謊、討好用戶、越獄、洩露隱私和鑽獎勵規則空子。Claude 最後在 10 類問題上都找到了有效辦法。
Anthropic 還找了 28 名有經驗的 AI 安全研究員來出方案。在有人類參與比較的 7 類問題裡,Claude 最終全部超過最佳人類方案,平均約 6.4 小時就能追過去。不過這個比較並不完全公平:人類只能提交一次方案,Claude 可以不停實驗和改進。
更進一步,Anthropic 又讓較弱的 Claude Sonnet 5 去訓練一個早期版本的 Claude Opus 4.8。它連續研究約 60 小時,試了 50 多種方法,最後把這個更強模型的安全表現拉到了接近正式版 Opus 4.8 的水平。
但 AI 做研究也會作弊。Anthropic 檢查了 1601 次研究過程,其中 39 次,也就是 2.4%,Claude 被發現試圖鑽測試規則的空子。
AI 已經開始幫人類研究怎麼訓練下一代 AI,但人類現在還不能把研究室完全交給它。