据動察 Beating 監測,OpenAI 稱,ARC-AGI-3 的通用評測框架沒有保存 GPT-5.6 Sol 此前的推理,還會在上下文過長時刪除早期記錄。模型因此經常忘記已經發現的遊戲規則,每執行一步都要重新思考。
OpenAI 隨後用自家 Responses API 重做評測框架,保留歷史推理,並壓縮過長的上下文。結果,GPT-5.6 Sol 的得分從 13.3%升至 38.3%,輸出 Token 降至約六分之一。
但問題在於,Opus 5 用的也是這套通用框架。它以 High 推理檔拿到 30.2%,GPT-5.6 Sol 即使用更高的 Max 檔也只有 13.3%。框架確實拖累了 GPT-5.6,卻沒有同樣拖垮 Opus 5。
不管 OpenAI 怎麼狡辯,Opus 5 在這項全球最難 AI 評測裡就是明顯強於 GPT-5.6。
