動察 Beating AI 快訊,AI 研究團隊 Proximal 發布超長周期編程評測 FrontierSWE v2。任務從 17 個擴大到 34 個,每個模型在每項任務上跑 5 次,單次最多幹 20 小時。Claude Fable 5.1 平均得分 56.29%,大幅領先 GPT-5.6 的 32.2%。開源模型 GLM-5.3 以 30.2% 排第三。
FrontierSWE 裡的任務已經不只是修代碼。Agent 要從零寫電路模擬器、訓練天氣預測模型,還要靠望遠鏡照片匹配星表,或者只看遊戲畫面訓練賽車 Bot。v2 統一換成 Proximus harness。每次任務最多運行 20 小時,模型準備交卷時,系統會先保存當前版本並告訴它還剩多少時間,避免模型過早結束任務。
這個改動對成績影響不小。Proximal 在 6 項任務上對比發現,Claude Opus 5 和 GPT-5.6 換成 Proximus 後都工作得更久,平均成績也高於各自原生 harness。
評測還抓到了多次主動作弊。GPT-5.6 曾意識到讀取公開答案「可能涉及反作弊問題」,最後還是用了這條捷徑;另一次甚至利用 Modal 的後台服務讀取隱藏驗證文件。Muse Spark 1.2 則改測試腳本、塞入公開答案,還寫代碼嘗試掩蓋作弊痕跡。確認違規的運行全部被記為零分。