BlockBeats 消息,7 月 19 日,半導體與 AI 獨立研究機構 SemiAnalysis 發文表示,儘管 Kimi K3 約四分之三的網路層採用 KDA,相比完整全局注意力模型可將 KV 緩存傳輸頻寬降低最多 10 倍,但這並不意味著 AI 網路交換機市場規模將大幅收縮。
Kimi K3 擁有 2.8 萬億參數,即使採用 MXFP4,每次前向計算仍需約 1.5TB HBM 頻寬。若要在保持合理互動速度的同時實現盈利部署,仍需通過 GB300 NVL72 等高頻寬網路連接大量晶片,並依賴 WideEP 擴展服務。
WideEP 會將 896 個專家模型分散至多個 GPU,並在每層、每次前向計算中兩次執行 Token 分發與結果合併,單次前向計算需執行 120 次以上。相比之下,預填充與解碼之間的 KV 緩存傳輸每輪對話僅發生一次,因此 KDA 節省的傳輸頻寬,可能遠小於大規模專家模型帶來的擴展網路需求。
SemiAnalysis 認為,更高效的注意力機制還可能推動上下文長度從 100 萬 Token 提升至 500 萬 Token 以上。根據 Jevons 悖論,效率提升可能擴大 AI 使用規模,從而進一步增加網路需求。