動察 Beating AI 快訊,騰訊混元等團隊發布 EvolveScaler,專門測試大模型能不能跟上不斷變化的資訊。它會在長文本裡不斷加入修改、撤回、補錄和作廢的資訊,再讓模型根據最新狀態回答問題。
比如先給模型看 40 天遊戲記錄,再問:「如果第 7 天沒打那個小 Boss,最後還能不能打贏?」這會連帶改變後面的裝備、血量和戰鬥結果。模型得從第 7 天開始,把後面幾十天重新推一遍,原文裡沒有現成答案。
團隊設計了 117 類任務、159 種問題,最長約 1200 個事件。14 個模型配置包括 GPT-5.5、Gemini 3.1 Pro、DeepSeek V4 Preview Pro、GLM-5.2 和 Qwen3.5 Plus。最難檔裡,成績中位數只有 11.3%;表現最好的 GPT-5.5-xhigh 也只有 59.3%。
這套數據也能拿來訓練模型。一個內部 A3B 模型加入 6000 條這類數據後,在 8 個外部測試上全部提升,平均提高 5.25 分。