header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

循環Transformer新架構:RLT讓Token之間「接著算」

動察 Beating AI 快訊,普林斯頓博士生 Yifan Zhang 提出 Recurrent Looped Transformer(RLT),給 Transformer 加了一條會一直往後傳的內部狀態。


普通 Transformer 生成下一個 Token 時,主要透過 Attention 和 KV 快取讀取前文。RLT 除了看前文,還會把上一個 Token 算完留下的內部狀態,直接交給下一個 Token 繼續用。


可以把它理解成給模型加了一根「思維接力棒」。第一個 Token 算完,把當前狀態傳給第二個;第二個更新後再傳給第三個。每個 Token 自己跑的網路層數沒有變,但這根狀態鏈會隨著文本越來越長。論文把它稱為「無限時間深度」,指的就是這條計算鏈沒有固定長度上限。


它和最近討論較多的 Ouro、Astra 類循環架構也不太一樣。那類方法主要讓同一個 Token 在同一套網路裡多跑幾輪;RLT 則讓不同 Token 之間持續傳遞內部狀態。前者像一道題交卷前多檢查幾遍,後者更像上一棒跑完,把手裡的進度直接交給下一棒。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成