動察 Beating AI 快訊,OpenAI 自 9 月 3 日發布 GPT-6 Astra 後,多項模型評測基準數據被持續調整,部分修改使 Astra 表現更優,同時部分競爭對手模型的成績出現下滑,引發外界對 AI「刷榜」和評測透明度的質疑。
其中,Astra 的幻覺率曾從 4.2% 下調至 2%,GPT-5.6 Sol 則從 12.2% 降至 9.4%,隨後兩者又恢復至 4.2% 和 12.2%。在數學評測中,Anthropic 的 Fable 5.1 得分也曾從 87.8% 降至 78%,目前已回升至 83%;GPT-5.6 Sol 則從 83% 降至 80.5%,後恢復至 83%。
此外,Astra 在 ARC-AGI-3 評測中的成績從發布前草稿的 98.6% 提升至最終頁面的 99.99%,其編程評測成績也從 57.7% 小幅上調至 57.9%。OpenAI 表示,評測結果會受到模型版本、工具配置、推理級別及測試運行等因素影響,此次調整是為了確保數據更準確地反映模型的最佳性能。
不過,斯坦福大學研究人員認為,頻繁重新運行評測可能涉及所謂「Benchmaxxing」,即通過調整測試條件最大化基準成績。業內人士指出,隨著 AI 模型競爭加劇,評測數據已成為衡量模型能力及爭奪市場的重要工具,如何提高基準測試的透明度和可複現性正受到越來越多關注。