header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

Claude防蒸餾或難以奏效:小模型能直接套出大模型思維鏈

動察 Beating 監測,大型模型廠商為了防止能力被蒸餾,會隱藏完整思維鏈,只給用戶一份摘要。但最新研究發現,這層保護可能沒有想象中牢固:把 Opus 的加密思維鏈交給同廠更弱的 Haiku,再越獄 Haiku,就能讓它直接複述 Opus 的原始推理。研究者在 Claude、GPT 和 Gemini 上都跑通了。

這件事其實已經鋪墊了幾個月。5 月,密碼學家 Matthew Green 發現這些加密思維鏈可以跨會話、跨帳號重播,但當時還沒找到穩定讀取內容的方法。新論文把最後一步補上了:不用破解加密演算法,直接讓廠商自己的模型幫你「解密」。

更早的 3 月,現 Engram 聯合創始人兼研究負責人 John X. Morris 等人還證明了另一條路:即使完全拿不到原始思維鏈,只看答案和推理摘要,也能反推出一套詳細的合成推理,再用於訓練小模型。

這也讓此前流傳的「國內 AI 公司早已找到辦法獲取 Claude、Codex 原始推理,再拿去訓練模型」的說法,在技術上更說得通了。但這仍只能證明方法可行,不能證明任何國內 AI 實驗室實際這麼做過。

論文還測了 Kimi K3。只給它塞幾個 Opus 的推理 Token,K3 後面的推理就會明顯向 Opus 靠攏;部分 Claude、GPT 的原始推理片段,從 Kimi K3 中提取出來最高比其他模型容易約 6 個數量級,但作者明確說無法據此證明蒸餾。

糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成