動察 Beating AI 快訊,普林斯頓博士生 Yifan Zhang 提出 Recurrent Looped Transformer(RLT),給 Transformer 加了一條會一直往後傳的內部狀態。
普通 Transformer 生成下一個 Token 時,主要透過 Attention 和 KV 快取讀取前文。RLT 除了看前文,還會把上一個 Token 算完留下的內部狀態,直接交給下一個 Token 繼續用。
可以把它理解成給模型加了一根「思維接力棒」。第一個 Token 算完,把當前狀態傳給第二個;第二個更新後再傳給第三個。每個 Token 自己跑的網路層數沒有變,但這根狀態鏈會隨著文本越來越長。論文把它稱為「無限時間深度」,指的就是這條計算鏈沒有固定長度上限。
它和最近討論較多的 Ouro、Astra 類循環架構也不太一樣。那類方法主要讓同一個 Token 在同一套網路裡多跑幾輪;RLT 則讓不同 Token 之間持續傳遞內部狀態。前者像一道題交卷前多檢查幾遍,後者更像上一棒跑完,把手裡的進度直接交給下一棒。