header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

小米先公開MiMo-V3新架構:百萬Token預填充計算量降80%

動察 Beating AI 快訊,小米 MiMo 團隊公開下一代 MiMo-V3 將採用的 HySparse2 架構。它主要解決 Agent 越跑越貴的問題。Agent 每次只發出很短的指令,卻可能從網頁、終端和工具拿回大段內容。模型必須先把這些新內容讀完;上下文越長,這一步越耗算力,KV Cache 也越佔顯存。


HySparse2 先把模型分成前後兩段。前半段負責處理輸入,後半段繼續推理和生成。後半段需要的上下文資訊,可以直接從前半段已經算好的結果生成,因此 prefill 不用再把後半段完整跑一遍。這個思路來自微軟研究院 2024 年提出的 YOCO,名字就是「You Only Cache Once」,核心是讓後半段共享前面算好的資訊,少存快取,也少做重複計算。


它同時重做了稀疏注意力。普通全注意力每次都要看完整上下文,HySparse2 只讓少數層這麼做。它們先從長上下文裡挑出最相關的 1024 個 token,後面的層直接沿用這批結果,同時固定保留最近 128 個 token。上一代 HySparse 是每 64 個 token 打成一组再挑,只要一組裡有重要資訊,整組都要留下。現在改成逐個 token 挑,同樣的計算量可以留給更多真正相關的內容。單獨測試這一改動後,兩項長文本檢索成績分別提高 6.57 分和 8.14 分。


論文用一款總參數 800 億、每次激活約 30 億參數的模型做對照。49 層模型在 prefill 階段只需要跑前 25 層。輸入達到 100 萬 token 時,相比 MiMo-V2 系列採用的混合滑動視窗注意力,prefill 計算量降到約 1/5,KV Cache 從 12.09GB 降到 2.69GB。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成