動察 Beating AI 快訊,第三方評測機構 Artificial Analysis 公佈 Claude Haiku 5.5 的測試結果。新模型在綜合智能指數中獲得 43 分,比上一代的 17 分提高 26 分。它超過 GPT-6 Luna 的 38 分、GLM-5.3 Flash 的 42 分,接近 Kimi K3 的 44 分。該指數綜合了編程、專業工作、科學推理等 10 項測試。
不過,高分也伴隨著大量 token 消耗。在最高推理強度下,Haiku 5.5 每項評測任務平均輸出約 16.2 萬 tokens,是 GPT-6 Luna 的 3.2 倍。兩者基礎 API 單價相同,但 Haiku 5.5 的預估單任務成本約為 0.21 美元,Luna 僅為 0.07 美元。Haiku 5.5 從次高檔調至最高檔,綜合得分只增加 2 分,輸出量卻增加約 80%。
降低推理強度後,差距明顯縮小。Haiku 5.5 在 high 檔獲得 38 分,平均每項任務輸出約 5.5 萬 tokens,與最高檔 GPT-6 Luna 的 38 分和 5 萬 tokens 接近。開發者可以通過調整推理強度,減少不必要的 token 消耗。
Haiku 5.5 也並非全面領先。在 AutomationBench-AA 自動化任務評測中,它僅得 35%,落後於 Luna 的 53%。不過,測試期間模型存在過度拒絕執行任務的問題。Anthropic 正在修復,Artificial Analysis 計劃重新測試。此外,目前公佈的 Haiku 5.5 任務成本尚未計入長上下文加價,實際費用可能更高。
