動察 Beating AI 快訊,Hy4 預覽剛開源,腾訊混元又放出了一個極限量化版。原始模型權重接近 1.5TB,新版 GGUF 只有約 214GB,大幅降低了這款 770B MoE 模型的本地部署門檻。
它並不是把整個模型都壓成 1.25-bit。腾訊按不同層對精度的敏感程度分別量化,能扛的部分最低壓到約 1.31-bit,敏感部分保留 2-bit 甚至更高精度。最終整個檔案平均約 2.38 bpw。腾訊給出的四項評測中,相較於 BF16 原版只下降了 0.2 到 1.6 分。
壓小以後,腾訊還和 prima.cpp 測試了異構設備聯合推理。一台 RTX 4090 筆記本加一台四卡 A4000 伺服器,總共只有 80GB 顯存和 64GB 內存,最終把模型跑到了 1.02 token/s,比筆記本單機 offload 快約 6 倍。幾台不同配置的設備,也可以一起分擔模型推理。