動察 Beating AI 快訊,上海 AI Lab 和上海交大發布 89 億參數模型 NCP-ArchPreview。普通大模型主要訓練「猜下一個 token」,NCP 還會預測後面一小段對應的內部概念信號,再用它輔助 token 生成。最終仍然逐 token 輸出,但模型內部已經會提前猜後文。
這套信號還能拿來給投機解碼提速。DFlash、DSpark 這類方案會讓一個小模型先猜後文,再交給大模型統一檢查。NCP 團隊把內部概念信號也交給這個小模型,相當於先給它一點「後面大概怎麼寫」的提示,再讓它一次並行猜 16 個 token。
這樣一來,小模型猜中的內容更多。四項測試裡,大模型每驗證一次,平均能通過的 token 從 5.933 個升到 6.180 個,提升 4.17%;HumanEval 上提升 7.59%。接入這套信號只給草稿模型增加約 4 萬參數。
同樣是 89 億參數,NCP 用普通 Transformer 約 85% 的訓練計算量,就能把訓練誤差降到差不多的水平。