header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

離真正替程式設計師還遠:Agent進企業私有程式碼,最高通過率也只有四成

動察 Beating AI 快訊,YC 孵化的 AI 數據公司 Specific Labs 推出編程評測 Real-SWE,專門拿真實公司的私有代碼測試 Coding Agent。任務直接來自企業生產環境,包括算稅、賬單遷移、API 計費和客戶數據遷移。代碼和答案都沒公開在網上,Agent 得自己摸清公司的業務規則和代碼結構。


結果 Fable 5.1 排第一,通過率也只有 38.8%;GPT-6 Astra 為 33.8%,Gemini 3.8 Flash 為 31.2%。GLM 5.3 以 28.8% 排第四,高於 Grok 4.6、Kimi K3 和 GPT-5.6 Sol。當前公開的 10 個任務裡,有 6 個整體通過率低於 15%,還有一個任務所有模型全部失敗。


最讓人意外的是 GLM 5.3。Real-SWE 更考驗 Agent 在陌生項目裡持續讀代碼、找規則和完成多步改動的能力。智譜研究員 Xiaopu Peng 回應稱,他們從 GLM-5.1 起就在訓練長程任務,Real-SWE 比公開 SWE 榜更接近這類能力,這也能部分解釋 GLM 5.3 為什麼在這套榜上表現突出。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成