header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

Terminal-Bench 4.0:GLM-5.3衝到第三,超過GPT-5.6 Sol

動察 Beating AI 快訊,Terminal-Bench 發布 4.0,重新校準 Agent 執行任務時的時間、CPU 和內存,並修復 19 個任務、移除 8 個存在飽和、拒答、公開解法或品質問題的任務。所有任務的最長執行時間統一到 8 小時,主要是減少超時和環境問題對成績的干擾。


最新榜單裡,Opus 5 + Claude Code 以 51.8% 排第一,Fable 5 以 44.5% 第二。GLM-5.3 + Claude Code 拿到 41.8%,衝到第三,超過 GPT-5.6 Sol + Codex 的 37.3%。前三名裡,GLM-5.3 是唯一不是 Anthropic 的模型。


在 Terminal-Bench 3.0 中,GLM-5.3 還是 32.4% 排第四,落後 GPT-5.6 Sol 的 34.6%;到了 4.0,GLM-5.3 升到第三,反過來領先 Sol 4.5 個百分點。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成