据 動察 Beating 監測,Baseten 工程師 Ali 發布長文,從 GPT-2 一路拆解到 Kimi K3。按參數量計算,一個 K3 相當於約 22580 個 GPT-2。但他認為,過去七年的真正變化並非單純擴大模型,而是不斷改造模型保存、更新和找回信息的方式。
GPT-2 使用全注意力。每個 Token 都留下自己的 Key 和 Value,後續可以隨時回看。信息保存最完整,但上下文越長,KV Cache 和計算成本越高。
線性注意力把整段歷史壓進固定大小的狀態。成本不再隨上下文持續膨脹,代價是不同信息會擠在同一塊空間裡。內容越來越多後,舊記憶開始互相干擾。
此後的多項架構創新,都在給這塊有限記憶增加管理規則。DeltaNet 允許模型先讀取舊內容,再用新舊差異進行覆蓋。Gated DeltaNet 加入整體遺忘,讓舊信息能夠隨場景變化衰減。
KDA 進一步把遺忘控制細化到每個通道。不同信息可以擁有不同保存時間:長期事實保留更久,臨時指令和局部變數更快衰減。Ali 認為,這才是 Kimi Linear 最關鍵的進步。
但固定狀態不可能保留所有細節。K3 因此沒有只用 KDA,而是把 23 組四層結構排列成「三層 KDA 加一層 MLA」,最後再補一層 MLA。KDA 負責低成本維護長期記憶,MLA 定期回看完整上下文,找回數字、代碼和早期指令等精確信息。
K3 還引入 Attention Residuals。普通模型會把每一層結果不斷相加,早期提取出的信息容易在 93 層計算中被後續結果稀釋。K3 把網路按 12 層分塊,讓後面的層按需調用較早階段形成的中間表示,不必每次都從原文重新推導。
因此,K3 的關鍵並不是某一項突然出現的黑科技。它真正特別的地方,是把循環記憶、全局檢索、層間回看和專家路由組合成一套分層信息系統。
過去七年的模型架構演進,本質上是在教模型如何選擇什麼值得留下,什麼應該覆蓋,什麼時候必須翻回原文。
