据 動察 Beating 監測,Arena Agent 榜基於真實用戶任務和工具調用記錄。Kimi K3 的綜合淨提升為 9.62%,排名第 4。它排在 Claude Fable 5、Claude Opus 4.8 Thinking 和 GPT-5.6 Sol 之後。
Arena 把所有參評模型均勻混合成一個虛擬平均基準,再估算換成 K3 後,各項結果改善多少。五項淨提升最後取平均,得到綜合分。
K3 已積累 8344 次測試會話。用戶確認成功指標淨提升 14.42%,排名第一。表揚多於投訴指標提升 20.62%,排名第三。它的糾錯執行排名第 14,Bash 報錯恢復排名第 17。K3 更容易交出讓用戶認可的結果,但中途改錯和命令報錯恢復仍是短板。