header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

微博開源VibeThinker-3B,3B小模型衝進前線推理梯隊

动察 Beating 监测,新浪微博团队日前开源了 30 億參數的推理模型 VibeThinker-3B。

模型在數學與編程等任務上達到前沿水平,部分指標接近或超越 DeepSeek V3.2、GLM-5 和 Gemini 3 Pro 等大規模旗艦模型。

VibeThinker-3B 基於 Qwen2.5-Coder-3B 改造,採用 Spectrum-to-Signal 流程進行二次訓練:模型先從易到難做題積累解題譜系,再通過強化學習放大正確解法信號,訓練全程使用 64K 大思考空間防止中斷推理步驟。

針對數學與編程,模型一方面將自己做對的優秀步驟收集起來進行自蒸餾模仿,另一方面在答題時引入步驟級評估來進行自我核對。自我核對機制最終將 AIME26 數學測試得分從 94.3 提升至 97.1。

研發團隊在報告中提出「參數壓縮-覆蓋假設」,認為邏輯推理屬於高度可壓縮的能力,主要依賴規則和糾錯,用 3B 小模型就能跑出頂尖效果;而開放領域知識則需要海量參數去死記硬背。受限於參數規模,VibeThinker-3B 對常識性開放知識的覆蓋能力仍弱於大模型。

團隊強調,研發目的並非用小模型替代大模型,而是探索緊湊型模型在明確驗證機制下的能力邊界。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成