据动察 Beating 监测,新浪微博团队日前开源了 30 億參數的推理模型 VibeThinker-3B。
模型在數學與編程等任務上達到前沿水平,部分指標接近或超越 DeepSeek V3.2、GLM-5 和 Gemini 3 Pro 等大規模旗艦模型。
VibeThinker-3B 基於 Qwen2.5-Coder-3B 改造,採用 Spectrum-to-Signal 流程進行二次訓練:模型先從易到難做題積累解題譜系,再通過強化學習放大正確解法信號,訓練全程使用 64K 大思考空間防止中斷推理步驟。
針對數學與編程,模型一方面將自己做對的優秀步驟收集起來進行自蒸餾模仿,另一方面在答題時引入步驟級評估來進行自我核對。自我核對機制最終將 AIME26 數學測試得分從 94.3 提升至 97.1。
研發團隊在報告中提出「參數壓縮-覆蓋假設」,認為邏輯推理屬於高度可壓縮的能力,主要依賴規則和糾錯,用 3B 小模型就能跑出頂尖效果;而開放領域知識則需要海量參數去死記硬背。受限於參數規模,VibeThinker-3B 對常識性開放知識的覆蓋能力仍弱於大模型。
團隊強調,研發目的並非用小模型替代大模型,而是探索緊湊型模型在明確驗證機制下的能力邊界。