header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

2.78兆參數 Kimi K3 實現 8GB 記憶體運行,開發者開源輕量 C 推理引擎

BlockBeats 消息,8 月 8 日,有開發者近日開源項目 kimi-k3-in-c,嘗試讓擁有 2.78 萬億參數的 Kimi K3 模型在僅 8GB 內存的設備上運行。該項目僅 176KB,採用純 C99 編寫,不依賴 GPU、CUDA、PyTorch 或 BLAS,僅通過 CPU 即可完成模型推理。


該方案利用 Kimi K3 的 MoE(混合專家)架構特性。雖然模型總參數規模達到 2.78T,但每層 896 個專家中僅啟動 16 個,因此開發者沒有將完整約 1.56TB 模型權重加載進內存,而是將大部分專家權重存儲在 NVMe 硬盤中,根據推理需求實時讀取;同時,部分密集層(dense trunk)也採用逐層流式加載方式。


不過,該方案目前仍存在明顯性能限制。在 8GB 內存模式下,模型生成一個 token 大約需要 32.7 秒,同時需要接近 1.7TB 高速存儲空間支持。


開發者表示,這一方案目前更像是對大模型推理基礎設施優化方向的一次實驗探索,並不具備實際生產使用價值,但其通過「硬盤流式加載+MoE 稀疏啟動」的方式,為未來低成本運行超大規模模型提供了一種新思路。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成