据動察 Beating 監測,千問正式開源 Qwen3.8-27B,官方跑分也一起公佈。這個只有 27B 參數的本地模型,在官方列出的 8 項可直接對比測試中,全部超過 Meta 剛發布的 30B 模型 Muse Glimmer。
差距在 Agent 和編程上尤其明顯。Terminal-Bench 2.1,Qwen3.8-27B 得分 73.0,Muse Glimmer 為 51.7;SWE-bench Pro 是 61.7 對 51.2;OSWorld-Verified 則是 84.3 對 65.9。通用推理、文檔和視覺測試也全部領先。
更誇張的是和 Claude Opus 4.6 對比。兩邊都有成績的 19 項測試中,Qwen3.8-27B 贏了 15 項。SWE-bench Pro、LiveCodeBench、OSWorld、AndroidWorld 和多項視覺任務都已經反超;Terminal-Bench、GPQA、HLE 和 NL2Repo 仍落後。
一個能在個人電腦本地跑的 27B 模型,官方跑分已經摸到了上一代閉源旗艦的水平。