header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

Haiku 5.5獨立評測43分:遙遙領先GPT-6 Luna,但最高檔Token消耗超3倍

動察 Beating AI 快訊,第三方評測機構 Artificial Analysis 公佈 Claude Haiku 5.5 的測試結果。新模型在綜合智能指數中獲得 43 分,比上一代的 17 分提高 26 分。它超過 GPT-6 Luna 的 38 分、GLM-5.3 Flash 的 42 分,接近 Kimi K3 的 44 分。該指數綜合了編程、專業工作、科學推理等 10 項測試。


不過,高分也伴隨著大量 token 消耗。在最高推理強度下,Haiku 5.5 每項評測任務平均輸出約 16.2 萬 tokens,是 GPT-6 Luna 的 3.2 倍。兩者基礎 API 單價相同,但 Haiku 5.5 的預估單任務成本約為 0.21 美元,Luna 僅為 0.07 美元。Haiku 5.5 從次高檔調至最高檔,綜合得分只增加 2 分,輸出量卻增加約 80%。


降低推理強度後,差距明顯縮小。Haiku 5.5 在 high 檔獲得 38 分,平均每項任務輸出約 5.5 萬 tokens,與最高檔 GPT-6 Luna 的 38 分和 5 萬 tokens 接近。開發者可以通過調整推理強度,減少不必要的 token 消耗。


Haiku 5.5 也並非全面領先。在 AutomationBench-AA 自動化任務評測中,它僅得 35%,落後於 Luna 的 53%。不過,測試期間模型存在過度拒絕執行任務的問題。Anthropic 正在修復,Artificial Analysis 計劃重新測試。此外,目前公佈的 Haiku 5.5 任務成本尚未計入長上下文加價,實際費用可能更高。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成