据动察 Beating 监测,腾讯混元团队联合多所高校发布 LHTB,专门测试 AI Agent 能否在终端里持续完成复杂任务。
基准包含 46 项任务,覆蓋軟體工程、實驗複現、科學計算和多模態分析等領域。每項最長運行 90 分鐘,通常需要連續操作數百步。
LHTB 不只看最終成敗。任務完成一部分,也會按實際進度給分。隱藏驗證器會檢查文件、測試結果和程式輸出,Agent 自稱完成不算。
論文首版測試了 15 個模型。GPT-5.5 完成 7 項,排名第一。每個模型執行一項任務,平均消耗約 990 萬 Token,耗時約 85 分鐘。
當前公開結果已擴至 20 個模型。Grok 4.5 以平均得分 0.505 登頂,完成 13 項。46 項任務中,仍有 29 項沒有任何模型達到完成標準。
多數 Agent 能完成部分步驟,卻經常耗盡 90 分鐘,或在任務尚未完成時提前收工,無法把複雜任務真正做完。