動察 Beating AI 快訊,非營利 AI 評測機構 ARC Prize 預告 ARC-AGI-4。下一代 benchmark 將重點測試「自主開放式創新」,看 AI 能不能自己探索、提出新想法,甚至做出新的發明和發現。
具體題目、評分方式和發布時間都還沒公布。ARC Prize 只說,人類目前在開放式創新上仍明顯領先 AI,這也是推動科學和技術進步最關鍵的能力之一。
這條預告還引用了 Dario Amodei 剛發布的 AI 減速文章。ARC Prize 強調,開源仍然是 AI 進步的基礎,反對行業為了協調減速而減少開放、把前沿 AI 集中在少數機構手裡。
ARC-AGI 一直被冠以全球最難 AGI 評測的稱號。ARC-AGI-3 發布時,人類得分 100%,前沿 AI 只有 0.51%。最新 GPT-6 Astra 已經大幅追上,但在統一的 Standard harness 下也只有 62.7%;接入 OpenAI 自家的 Provider Adapter 後才衝到 99.9%。
ARC Prize 現在又準備把下一關推到「AI 能不能自己搞創新」。