header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

OpenAI稱評估框架拖累GPT-5.6表現,但Opus 5用同一框架分數高2.3倍

動察 Beating 監測,OpenAI 稱,ARC-AGI-3 的通用評測框架沒有保存 GPT-5.6 Sol 此前的推理,還會在上下文過長時刪除早期記錄。模型因此經常忘記已經發現的遊戲規則,每執行一步都要重新思考。

OpenAI 隨後用自家 Responses API 重做評測框架,保留歷史推理,並壓縮過長的上下文。結果,GPT-5.6 Sol 的得分從 13.3%升至 38.3%,輸出 Token 降至約六分之一。

但問題在於,Opus 5 用的也是這套通用框架。它以 High 推理檔拿到 30.2%,GPT-5.6 Sol 即使用更高的 Max 檔也只有 13.3%。框架確實拖累了 GPT-5.6,卻沒有同樣拖垮 Opus 5。

不管 OpenAI 怎麼狡辯,Opus 5 在這項全球最難 AI 評測裡就是明顯強於 GPT-5.6。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成