header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

SemiAnalysis:Kimi K3大幅降低KV傳輸頻寬,但不會縮減AI網路需求

BlockBeats 消息,7 月 19 日,半導體與 AI 獨立研究機構 SemiAnalysis 發文表示,儘管 Kimi K3 約四分之三的網路層採用 KDA,相比完整全局注意力模型可將 KV 緩存傳輸頻寬降低最多 10 倍,但這並不意味著 AI 網路交換機市場規模將大幅收縮。


Kimi K3 擁有 2.8 萬億參數,即使採用 MXFP4,每次前向計算仍需約 1.5TB HBM 頻寬。若要在保持合理互動速度的同時實現盈利部署,仍需通過 GB300 NVL72 等高頻寬網路連接大量晶片,並依賴 WideEP 擴展服務。


WideEP 會將 896 個專家模型分散至多個 GPU,並在每層、每次前向計算中兩次執行 Token 分發與結果合併,單次前向計算需執行 120 次以上。相比之下,預填充與解碼之間的 KV 緩存傳輸每輪對話僅發生一次,因此 KDA 節省的傳輸頻寬,可能遠小於大規模專家模型帶來的擴展網路需求。


SemiAnalysis 認為,更高效的注意力機制還可能推動上下文長度從 100 萬 Token 提升至 500 萬 Token 以上。根據 Jevons 悖論,效率提升可能擴大 AI 使用規模,從而進一步增加網路需求。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成