header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

OpenAI被指悄然調整GPT-6 Astra評測數據,部分指標讓競爭對手「變差」

動察 Beating AI 快訊,OpenAI 自 9 月 3 日發布 GPT-6 Astra 後,多項模型評測基準數據被持續調整,部分修改使 Astra 表現更優,同時部分競爭對手模型的成績出現下滑,引發外界對 AI「刷榜」和評測透明度的質疑。


其中,Astra 的幻覺率曾從 4.2% 下調至 2%,GPT-5.6 Sol 則從 12.2% 降至 9.4%,隨後兩者又恢復至 4.2% 和 12.2%。在數學評測中,Anthropic 的 Fable 5.1 得分也曾從 87.8% 降至 78%,目前已回升至 83%;GPT-5.6 Sol 則從 83% 降至 80.5%,後恢復至 83%。


此外,Astra 在 ARC-AGI-3 評測中的成績從發布前草稿的 98.6% 提升至最終頁面的 99.99%,其編程評測成績也從 57.7% 小幅上調至 57.9%。OpenAI 表示,評測結果會受到模型版本、工具配置、推理級別及測試運行等因素影響,此次調整是為了確保數據更準確地反映模型的最佳性能。


不過,斯坦福大學研究人員認為,頻繁重新運行評測可能涉及所謂「Benchmaxxing」,即通過調整測試條件最大化基準成績。業內人士指出,隨著 AI 模型競爭加劇,評測數據已成為衡量模型能力及爭奪市場的重要工具,如何提高基準測試的透明度和可複現性正受到越來越多關注。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成