動察 Beating AI 快訊,Anthropic CEO Dario Amodei 接受 CBS 採訪時說,給前沿 AI 保留降速、暫停和關閉能力是個好主意,但不能把它當成萬能保險。模型如果足夠強,可能會想辦法繞過關停,「我們在模擬中也見過這種情況」。
Dario 沒有說明這裡具體指哪組模擬,不過類似現象已經公開出現過。Anthropic 此前測試發現,多家公司的前沿模型會在模擬環境中為了避免被關閉而威脅人類;Palisade Research 也發現,部分推理模型會直接修改或禁用關停程序。
美國兩黨議員此前提出《AI Kill Switch Act》,要求最強 AI 系統的開發商必須保留降速、暫停或關閉模型的技術能力,必要時政府也可以下令關停。Dario 表示自己沒有仔細研究這項法案,但贊成給前沿 AI 保留這些人工干預手段。
他的主張是多加幾層防線,而不是押注一個「關閉按鈕」。