header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

字節揪出DeepSeek-V4隱藏盲區:代碼沒變,答案卻週期性出錯

動察 Beating AI 快訊,字節跳動 Seed 團隊發現,DeepSeek-V4 在長文本處理中存在一種規律性弱點。研究人員讓模型補全一段程式碼,程式碼本身沒有變化,只延長了前面一段無關註釋,模型的答案就會在正確和錯誤之間來回切換。V4-Flash 基礎版每隔 4 個 Token 重複一輪,V4.1-Flash 也存在類似現象,週期變成 2 個 Token。


問題與 DeepSeek 節省顯存的「分塊 KV 快取壓縮」有關。模型會把連續幾個 Token 的資訊合併保存,降低處理長文本的成本。但這種壓縮會讓不同位置的資訊得到不同程度的保留,某些位置的內容更難在之後被準確找回。字節將這種週期性檢索差異稱為「相位敏感性」。


在約 12.8 萬 Token 的檢索測試中,V4-Flash 基礎版在不同位置上的準確率最高相差 40.2 個百分點。經過後訓練,差距縮至 19.1 個百分點;V4.1-Flash 進一步縮至 6.1 個百分點,但週期性波動仍然存在。字節還從零訓練了多組對照模型,發現波動週期與壓縮步幅一致,未使用分塊壓縮的對照模型沒有出現相同規律。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成