据動察 Beating 監測,大型模型廠商為了防止能力被蒸餾,會隱藏完整思維鏈,只給用戶一份摘要。但最新研究發現,這層保護可能沒有想象中牢固:把 Opus 的加密思維鏈交給同廠更弱的 Haiku,再越獄 Haiku,就能讓它直接複述 Opus 的原始推理。研究者在 Claude、GPT 和 Gemini 上都跑通了。
這件事其實已經鋪墊了幾個月。5 月,密碼學家 Matthew Green 發現這些加密思維鏈可以跨會話、跨帳號重播,但當時還沒找到穩定讀取內容的方法。新論文把最後一步補上了:不用破解加密演算法,直接讓廠商自己的模型幫你「解密」。
更早的 3 月,現 Engram 聯合創始人兼研究負責人 John X. Morris 等人還證明了另一條路:即使完全拿不到原始思維鏈,只看答案和推理摘要,也能反推出一套詳細的合成推理,再用於訓練小模型。
這也讓此前流傳的「國內 AI 公司早已找到辦法獲取 Claude、Codex 原始推理,再拿去訓練模型」的說法,在技術上更說得通了。但這仍只能證明方法可行,不能證明任何國內 AI 實驗室實際這麼做過。
論文還測了 Kimi K3。只給它塞幾個 Opus 的推理 Token,K3 後面的推理就會明顯向 Opus 靠攏;部分 Claude、GPT 的原始推理片段,從 Kimi K3 中提取出來最高比其他模型容易約 6 個數量級,但作者明確說無法據此證明蒸餾。