動察 Beating AI 快訊,輝達支持的 AI 初創公司 Reflection 公布首個開放權重模型 Beam。它採用 MoE 架構,總參數 5010 億,每次只激活 230 億,主要面向代碼、推理和 Agent 任務。
從 Reflection 自己公布的成績看,Beam 整體表現接近 GLM-5.2,還沒追上最新的中國頭部開源模型。DeepSWE 上,Beam 得分 44.4,GLM-5.2 為 44.0,Qwen 3.8-Max 為 51.0,GLM-5.3、Kimi K3 和 DeepSeek V4.1 Flash 分別達到 61.0、68.0 和 74.2。
Beam 的訓練規模也很大。預訓練使用 6144 塊輝達 GB300,不到 4 週處理 23.8 萬億 token;隨後又用 1.05 萬塊 GB300 連續進行 4 週強化學習,生成超過 1 億條訓練軌跡(rollout)。官方稱,這是他們所知公開記錄中規模最大的強化學習訓練之一。
Beam 目前仍在最後的安全測試階段,只有少量用戶可以提前使用。Reflection 計劃本月晚些時候發布完整權重、技術報告和模型卡,並以 Apache 2.0 協議開放。
