header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

25款模型集體輸給人類:AI仍看不懂很多生活常識

動察 Beating AI 快訊,Scale AI 旗下研究機構 Scale Labs 聯合 Elorian 發布新評測 Humanity’s Sixth Sense(HSS),專門測試 AI 能否從圖片和影片中看出隱含資訊。522 道開放題涵蓋 288 張圖片和 234 段影片。比如,兩輛車之間能否通過、女子追公車時為什麼突然放慢腳步,以及一個場合中誰更有話語權。


研究團隊測試了 25 款多模態模型,並讓 20 名人類受試者答題。人類準確率達到 93.1%,排名第一的 GPT-6 Astra 即使用最大推理力度,也只有 53.6%。GPT-6.1 Sol 和 Claude Opus 5.5 分別獲得 46.6% 和 44.6%,所有模型的得分中位數僅 30.9%。


研究人員分析了 8573 次模型失敗,發現 94% 與漏看關鍵線索、認錯對象或無法推斷畫面中的隱含關係有關。只有約 5% 被歸類為邏輯推理錯誤。社交理解尤其困難,25 款模型中有 21 款在這類題上表現最差。影片題也普遍比圖片題更難。


增加推理量也未必有效。模型平均每題消耗約 4000 個推理 token,部分題目想得越久,成績反而越差。研究團隊還嘗試讓 Agent 放大、裁剪和反覆檢查畫面,成績有所提升,但仍與人類有明顯差距。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成