据動察 Beating 監測,美團開源超大規模混合專家(MoE)模型 LongCat-2.0。模型擁有 1.6 萬億總參數,單 token 激活參數約 480 億,支持 1M 超長上下文。
這是業界首個依靠國產算力完成訓練、推理全流程的萬億參數大模型。它在超過 5 萬張國產 AI 晶片集群上完成了 35 萬億 token 的預訓練,成功驗證了國產算力承載前沿大模型的工程穩定性。
LongCat-2.0 的核心更新集中在長上下文和推理效率。LongCat Sparse Attention(LSA)針對稀疏注意力索引帶來的顯存讀取和計算開銷,引入流感知索引、跨層索引和分層索引,讓長文本推理時的索引讀取更連續,也能在相鄰層之間複用部分索引結果。
模型還集成 1350 億參數的 5-gram 嵌入模組,通過建模相鄰 token 組合來擴展嵌入空間,增強局部上下文表達。相比只依賴 MoE 專家路由,這類前置嵌入可以在大 batch 推理中減少部分顯存讀寫壓力。
在 SWE-bench Pro 等主流 Agent 和代碼評測中,LongCat-2.0 表現逼近甚至超越部分主流閉源模型。