動察 Beating AI 快訊,Anthropic 開始給 Claude 的隱藏思考加「上下文鎖」。Fable 5.1 通過 API 生成的加密思考,以後必須和生成它時的系統提示、工具和歷史消息一起原樣傳回來。前面的內容只要被改過,API 就會報錯,或者直接丟掉這段思考。
這項改動就是為了防模型蒸餾。此前研究人員發現,Claude 的加密思考雖然用戶自己看不懂,卻可以重新交給 Anthropic 的兼容模型讀取。攻擊者可以先讓 Opus 產生高質量推理,再把加密塊塞給防護更弱的 Haiku,誘導它把 Opus 的完整思考念出來。相當於不只抄大模型的答案,連草稿紙上的解題過程也一起拿走。
Anthropic 6 月發布 Fable 5 時就堵過一輪,開始把加密思考綁定模型,不能再拿給 Haiku 這類小模型幫忙解密。Fable 5.1 這次又加上「對話綁定」:模型不換,只要改了前面的提示詞、工具或聊天記錄,舊思考同樣作廢。
這道鎖目前還沒有全面打開。8 月 31 日之後新開的 API 帳戶呼叫 Fable 5.1 時才會強制執行,老帳戶暫時不受影響。Claude.ai、Claude Code、Cowork 和其他 Claude 模型也不在範圍內。Anthropic 稱,未來發布的新模型會默認對所有用戶啟用這套規則。