動察 Beating AI 快訊,Coding Agent Devin 母公司 Cognition 發布新編程模型 SWE-2。它直接基於月之暗面 2.8T 參數的 Kimi K3 繼續做強化學習,進一步訓練後,多項編程評測又提高約 5 到 6 個百分點。
在 Cognition 自家的 FrontierCode 1.1 Main 上,SWE-2 得分 50.0%,超過 GPT-5.6 Sol 的 47.5% 和 Grok 4.6 的 48.0%。它距離 Fable 5.1 的 50.9% 只差 0.9 個百分點,但成本低 64%。GPT-6 Astra 得分 53.3%,SWE-2 與其相差 3.3 個百分點,成本約為四分之一。
SWE-2 也比上一代少走很多彎路。中等推理強度下,它完成任務的交互輪數減少 58%,平均成本下降 81%。不過在更難的 Terminal-Bench 4 上,SWE-2 只有 27.3%,明顯低於 Astra 的 57.9% 和 Fable 5.1 的 55.8%,還談不上全面追平前沿模型。
SWE-2 已上線 Devin Desktop 和 CLI,並開始推向 Devin Web 和 Fusion。
