根據動察 Beating 監測,螞蟻百靈正式開放 Ling-3.0-tiny 權重,提供 BF16、FP8 和 INT4 三個版本,Hugging Face 頁面標註為 MIT 許可。模型共有 79 億參數,每個 Token 只啟用 13 億,主要面向本地部署和 Agent 場景。
Ling-3.0-tiny 有 128 個路由專家,每個 Token 只選擇其中 8 個,再加 1 個所有 Token 都會使用的共享專家。注意力部分採用 3:1 的 KDA 與 MLA 混合架構,也就是每 3 層 Kimi Delta Attention 後接 1 層 MLA。
官方稱 FP8 版在 M1 Pro MacBook 上可達到約 86–90 Token/s;DGX Spark 上約為 100–105 Token/s。