動察 Beating AI 快訊,Terminal-Bench 發布 4.0,重新校準 Agent 執行任務時的時間、CPU 和內存,並修復 19 個任務、移除 8 個存在飽和、拒答、公開解法或品質問題的任務。所有任務的最長執行時間統一到 8 小時,主要是減少超時和環境問題對成績的干擾。
最新榜單裡,Opus 5 + Claude Code 以 51.8% 排第一,Fable 5 以 44.5% 第二。GLM-5.3 + Claude Code 拿到 41.8%,衝到第三,超過 GPT-5.6 Sol + Codex 的 37.3%。前三名裡,GLM-5.3 是唯一不是 Anthropic 的模型。
在 Terminal-Bench 3.0 中,GLM-5.3 還是 32.4% 排第四,落後 GPT-5.6 Sol 的 34.6%;到了 4.0,GLM-5.3 升到第三,反過來領先 Sol 4.5 個百分點。