根據動察 Beating 監測,Artificial Analysis 推出一個新的 AI 分析能力測試 AA-AnalystAgent。它讓模型處理真實的表格和文件,完成資料統計、趨勢分析、財務建模等工作。測試共有 80 道題,每道題讓模型獨立做 5 遍,只有 5 次全部答對才算通過。
結果第一名是 Claude Opus 5,但也只有 54% 的題能連續 5 次全部答對。GPT-5.5 排第二,通過率為 50%;Claude Fable 5 為 49%。開放權重模型裡表現最好的是 Kimi K3,為 39%。
如果只看每一次作答的平均正確率,GPT-5.5 其實最高,達到 66%。但要求同一道題連續做對 5 次後,它的通過率只剩 50%。Claude Opus 5 單次正確率稍低,卻更穩定,所以最終排在第一。
AI 最常見的問題還不是不會算,而是一開始就把題理解錯了。Artificial Analysis 分析了 1567 次失敗記錄,其中 57% 都出現了這種情況:模型過早認定一個錯誤解釋,隨後一直沿著這個方向做下去。