header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

AI當分析師還不夠靠譜:每道題做5遍,Claude Opus 5只有54%的題能全對

根據動察 Beating 監測,Artificial Analysis 推出一個新的 AI 分析能力測試 AA-AnalystAgent。它讓模型處理真實的表格和文件,完成資料統計、趨勢分析、財務建模等工作。測試共有 80 道題,每道題讓模型獨立做 5 遍,只有 5 次全部答對才算通過。

結果第一名是 Claude Opus 5,但也只有 54% 的題能連續 5 次全部答對。GPT-5.5 排第二,通過率為 50%;Claude Fable 5 為 49%。開放權重模型裡表現最好的是 Kimi K3,為 39%。

如果只看每一次作答的平均正確率,GPT-5.5 其實最高,達到 66%。但要求同一道題連續做對 5 次後,它的通過率只剩 50%。Claude Opus 5 單次正確率稍低,卻更穩定,所以最終排在第一。

AI 最常見的問題還不是不會算,而是一開始就把題理解錯了。Artificial Analysis 分析了 1567 次失敗記錄,其中 57% 都出現了這種情況:模型過早認定一個錯誤解釋,隨後一直沿著這個方向做下去。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成