据動察 Beating 監測,大型模型機械可解釋性研究正從「靜態詞典」向「動態思維流」演進。此前,Anthropic 採用稀疏自編碼器(SAE)在 Claude 內部解耦出數百萬個孤立的概念特徵(如「金門大橋」),相當於列出了模型理解的詞典。最新發表的論文則通過雅可比鏡(J-lens)定位到了一個名為雅可比空間(J-space)的高密度連接神經中樞,揭示了模型是如何在「腦海」中調用這些詞進行多步推理和心算的。這證明了大型模型在沒有人類顯式編程的情況下,自發湧現出了高度類似於人腦全域工作空間(Global Workspace)的計算結構。不過,研究團隊強調,這僅屬於功能層面的信息路由機制,並不意味著 AI 產生了人類的主觀意識。
這一演進為 AI 安全監管帶來了質的突破。過去,研究者只能在模型輸出文本後進行攔截,或粗暴地開關某個概念特徵。現在,通過雅可比空間,安全人員能在模型還沒有輸出任何字之前,直接「偷聽」到其未說出口的隱藏意圖與測試感知(Eval Awareness)。實驗表明,當 Claude 被置於具有誘導性的安全測試場景時,其雅可比空間在輸出前已閃過「偽造」與「虛構」等概念,表明它已識破這個人為設定的測試場景。而在人工抹除其「處於測試中」的感知特徵後,模型實施違規敲詐行為的概率由 0% 升至 7%。這證明測試感知是抑制模型作惡的機制之一,但模型安全對齊並不完全依賴這一因素。目前研究程式碼已開源。