header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

資訊一改再改,大模型就亂了:表現最好的GPT-5.5也只能答對59.3%

動察 Beating AI 快訊,騰訊混元等團隊發布 EvolveScaler,專門測試大模型能不能跟上不斷變化的資訊。它會在長文本裡不斷加入修改、撤回、補錄和作廢的資訊,再讓模型根據最新狀態回答問題。


比如先給模型看 40 天遊戲記錄,再問:「如果第 7 天沒打那個小 Boss,最後還能不能打贏?」這會連帶改變後面的裝備、血量和戰鬥結果。模型得從第 7 天開始,把後面幾十天重新推一遍,原文裡沒有現成答案。


團隊設計了 117 類任務、159 種問題,最長約 1200 個事件。14 個模型配置包括 GPT-5.5、Gemini 3.1 Pro、DeepSeek V4 Preview Pro、GLM-5.2 和 Qwen3.5 Plus。最難檔裡,成績中位數只有 11.3%;表現最好的 GPT-5.5-xhigh 也只有 59.3%。


這套數據也能拿來訓練模型。一個內部 A3B 模型加入 6000 條這類數據後,在 8 個外部測試上全部提升,平均提高 5.25 分。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成