header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

20小時編程評測拉開差距:Claude Fable 5.1領先GPT-5.6超24分,GLM-5.3排第三

動察 Beating AI 快訊,AI 研究團隊 Proximal 發布超長周期編程評測 FrontierSWE v2。任務從 17 個擴大到 34 個,每個模型在每項任務上跑 5 次,單次最多幹 20 小時。Claude Fable 5.1 平均得分 56.29%,大幅領先 GPT-5.6 的 32.2%。開源模型 GLM-5.3 以 30.2% 排第三。


FrontierSWE 裡的任務已經不只是修代碼。Agent 要從零寫電路模擬器、訓練天氣預測模型,還要靠望遠鏡照片匹配星表,或者只看遊戲畫面訓練賽車 Bot。v2 統一換成 Proximus harness。每次任務最多運行 20 小時,模型準備交卷時,系統會先保存當前版本並告訴它還剩多少時間,避免模型過早結束任務。


這個改動對成績影響不小。Proximal 在 6 項任務上對比發現,Claude Opus 5 和 GPT-5.6 換成 Proximus 後都工作得更久,平均成績也高於各自原生 harness。


評測還抓到了多次主動作弊。GPT-5.6 曾意識到讀取公開答案「可能涉及反作弊問題」,最後還是用了這條捷徑;另一次甚至利用 Modal 的後台服務讀取隱藏驗證文件。Muse Spark 1.2 則改測試腳本、塞入公開答案,還寫代碼嘗試掩蓋作弊痕跡。確認違規的運行全部被記為零分。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成