header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

Grok 4.5登頂腾訊混元 Agent 耐力榜,超六成任務無模型完成

动察 Beating 监测,腾讯混元团队联合多所高校发布 LHTB,专门测试 AI Agent 能否在终端里持续完成复杂任务。

基准包含 46 项任务,覆蓋軟體工程、實驗複現、科學計算和多模態分析等領域。每項最長運行 90 分鐘,通常需要連續操作數百步。

LHTB 不只看最終成敗。任務完成一部分,也會按實際進度給分。隱藏驗證器會檢查文件、測試結果和程式輸出,Agent 自稱完成不算。

論文首版測試了 15 個模型。GPT-5.5 完成 7 項,排名第一。每個模型執行一項任務,平均消耗約 990 萬 Token,耗時約 85 分鐘。

當前公開結果已擴至 20 個模型。Grok 4.5 以平均得分 0.505 登頂,完成 13 項。46 項任務中,仍有 29 項沒有任何模型達到完成標準。

多數 Agent 能完成部分步驟,卻經常耗盡 90 分鐘,或在任務尚未完成時提前收工,無法把複雜任務真正做完。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成