header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

Hermes模型榜上線,Opus 5.5第一,Astra第二卻最貴

動察 Beating AI 快訊,Nous Research 給 Hermes Agent 上線模型排行榜 Hermes Index,主要用來比較不同模型在 Hermes 裡的表現。所有模型都使用同一套 Hermes Agent 運行框架,支持調節推理強度的統一設為 high。榜單取 Hermes Bench、Terminal-Bench 4、Terminal-Bench Science 和 SkillsBench 四項測試的平均分,同時統計平均每任務成本。


其中 Hermes Bench 是 Nous Research 自己新做的測試,共有 150 個任務、25 類場景,覆蓋 Skills、研究、圖表與創作、記憶、工具調用和安全。Agent 會直接處理工作區和真實文件,最後根據生成的文件、任務狀態和工具使用記錄評分。


首版共測試 14 個模型。Claude Opus 5.5 以 63.31 分排第一,GPT 6 Astra 以 56.25 分第二,Claude Sonnet 5.5 以 53.14 分第三。Astra 平均每個任務花費 11.61 美元,是全榜最高。Opus 5.5 為 4.99 美元,Sonnet 5.5 為 2.82 美元,兩者部分數據仍被官方標為暫定。


低價模型中,DeepSeek V4.1 Flash 得到 36.91 分,平均每任務花費 0.259 美元;GPT 6 Luna 為 33.89 分,每任務 0.141 美元。兩者都進入成本與性能的 Pareto 前沿,也就是不存在價格更低、同時分數更高的模型。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成