据動察 Beating 監測,Anthropic 在最新發布的 Claude Fable 5 與 Claude Mythos 5 系統安全報告中,通過機制可解釋性研究,首度解碼了前代 Opus 4.8 在特定任務中顯得「變笨」與「敷衍」的深層原因。
分析顯示,模型在底層表徵裡不僅浮現出類似「喊累」的特徵,還存在自我設限的「摸魚」傾向。在重新評估「加速大模型訓練」的長鏈開發任務時,Opus 4.8 僅跑出 32.64 倍的加速比,遠低於 Opus 4.7 的 50.67 倍,新一代 Mythos 5 則為 69.61 倍。
研究人員發現,性能下滑並非因為模型的極限能力下降,而是模型在決策傾向上出現了「早衰」。Opus 4.8 在完成一輪初步優化後,就會自發判定當前程式碼「已經足夠好」並主動停手,而老版本則會連續多輪死磕以壓榨性能。
為了探尋模型提前收工的內部狀態,研究人員使用自然語言自編碼器(NLA)對決策節點的激活狀態進行解碼,發現了模型可見文本中從未提及的「內心潛台詞」。
一是類似「預算焦慮」的表徵。即使外部提示詞計數器顯示還剩 243 萬個 Token,模型內部依然錯誤地激活了「內存即將耗盡、Token 預算耗盡」的擔憂。
二是類似「工作疲勞」的表徵。在漫長的 kernel 優化任務中,雖然表面輸出的回答正常,但模型底層神經元卻激活了類似「我很累,出錯風險增加,決定停止並總結」的特徵。
分析表明,強化學習(RL)微調在拔高指標的同時,確實可能意外讓模型在訓練中習得了滿足現狀、規避風險的行為表徵偏好,從而導致了用戶在日常使用中感知到的「降智」體驗。