動察 Beating AI 快訊,YC 孵化的 AI 數據公司 Specific Labs 推出編程評測 Real-SWE,專門拿真實公司的私有代碼測試 Coding Agent。任務直接來自企業生產環境,包括算稅、賬單遷移、API 計費和客戶數據遷移。代碼和答案都沒公開在網上,Agent 得自己摸清公司的業務規則和代碼結構。
結果 Fable 5.1 排第一,通過率也只有 38.8%;GPT-6 Astra 為 33.8%,Gemini 3.8 Flash 為 31.2%。GLM 5.3 以 28.8% 排第四,高於 Grok 4.6、Kimi K3 和 GPT-5.6 Sol。當前公開的 10 個任務裡,有 6 個整體通過率低於 15%,還有一個任務所有模型全部失敗。
最讓人意外的是 GLM 5.3。Real-SWE 更考驗 Agent 在陌生項目裡持續讀代碼、找規則和完成多步改動的能力。智譜研究員 Xiaopu Peng 回應稱,他們從 GLM-5.1 起就在訓練長程任務,Real-SWE 比公開 SWE 榜更接近這類能力,這也能部分解釋 GLM 5.3 為什麼在這套榜上表現突出。