header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

大模型開始自己「打草稿」:NCP把猜後文塞進模型內部

動察 Beating AI 快訊,上海 AI Lab 和上海交大發布 89 億參數模型 NCP-ArchPreview。普通大模型主要訓練「猜下一個 token」,NCP 還會預測後面一小段對應的內部概念信號,再用它輔助 token 生成。最終仍然逐 token 輸出,但模型內部已經會提前猜後文。


這套信號還能拿來給投機解碼提速。DFlash、DSpark 這類方案會讓一個小模型先猜後文,再交給大模型統一檢查。NCP 團隊把內部概念信號也交給這個小模型,相當於先給它一點「後面大概怎麼寫」的提示,再讓它一次並行猜 16 個 token。


這樣一來,小模型猜中的內容更多。四項測試裡,大模型每驗證一次,平均能通過的 token 從 5.933 個升到 6.180 個,提升 4.17%;HumanEval 上提升 7.59%。接入這套信號只給草稿模型增加約 4 萬參數。


同樣是 89 億參數,NCP 用普通 Transformer 約 85% 的訓練計算量,就能把訓練誤差降到差不多的水平。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成