動察 Beating AI 快訊,Anthropic 正式開始落地「嵌入式評估」。埃森哲旗下 AI 公司 Faculty 將派人進入 Anthropic 內部,評測和紅隊測試模型、做對齊評估,並檢查安全措施。
這和普通的外部評測差別很大。評估員會拿到接近員工的權限,可以查看模型訓練過程,了解開發和部署決策,還能直接和內部員工溝通。
雙方未來五年各投入至少 10 億美元建設這套評估能力。Anthropic 也承認,目前行業連統一規則都沒有,評估員具體能看什麼、結果怎麼公開、錢由誰出都還在定。眼下埃森哲的評估工作由 Anthropic 直接付錢。
但埃森哲本身就是 Anthropic 的長期戰略合作夥伴,還專門成立了 Anthropic Business Group,培訓約 3 萬人使用 Claude。AI Evaluator Forum 同日提出的最低條件之一,恰恰是評估機構不應與被評公司存在重大商業往來。
Anthropic 之後還會引入其他評估機構,也在和 METR(也是 Anthropic 的老夥伴)等非營利組織談試點。
