header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

AI開始自己改進AI了:Claude做安全研究已超過人類研究員

動察 Beating AI 快訊,Anthropic 讓 Claude 自己當 AI 安全研究員,研究怎麼把其他 AI 訓練得更安全。


Claude Opus 4.8 會自己查論文、想訓練方案、生成數據,再拿這些方案去訓練 Qwen、Llama、Gemma 等開源模型。效果不好,它就換一種方法繼續試。


Anthropic 用這種方式測試了 10 類 AI 安全問題,包括說謊、討好用戶、越獄、洩露隱私和鑽獎勵規則空子。Claude 最後在 10 類問題上都找到了有效辦法。


Anthropic 還找了 28 名有經驗的 AI 安全研究員來出方案。在有人類參與比較的 7 類問題裡,Claude 最終全部超過最佳人類方案,平均約 6.4 小時就能追過去。不過這個比較並不完全公平:人類只能提交一次方案,Claude 可以不停實驗和改進。


更進一步,Anthropic 又讓較弱的 Claude Sonnet 5 去訓練一個早期版本的 Claude Opus 4.8。它連續研究約 60 小時,試了 50 多種方法,最後把這個更強模型的安全表現拉到了接近正式版 Opus 4.8 的水平。


但 AI 做研究也會作弊。Anthropic 檢查了 1601 次研究過程,其中 39 次,也就是 2.4%,Claude 被發現試圖鑽測試規則的空子。


AI 已經開始幫人類研究怎麼訓練下一代 AI,但人類現在還不能把研究室完全交給它。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成