動察 Beating AI 快訊,Anthropic 發布 GLM-5.3 網路安全評測,原意是警告開放權重模型可能降低網路攻擊門檻。但測試結果同時給 GLM-5.3 做了一次很硬的第三方背書:它已經能自主完成複雜漏洞利用,部分能力接近 Anthropic 自家的 Claude Mythos Preview。智譜股價今日盤中一度漲超 2%。
在 ExploitBench 上,GLM-5.3 的 410 次嘗試中有 50 次完成端到端漏洞利用,Claude Mythos Preview 為 56 次。Claude Opus 4.6、GLM-5.2、Kimi K3 和 DeepSeek-V4.1-Flash 在同一測試中都接近 0。Anthropic 稱,GLM-5.3 的漏洞利用能力已經跨過一個明顯門檻。
研究人員讓 GLM-5.3 在沙盒環境裡檢查一款主流瀏覽器,它在一天內發現多個此前未知的漏洞,還把多個 0-day 串成完整攻擊鏈。最終生成的惡意網頁可以逃出瀏覽器沙盒,直接讀取電腦裡的任意檔案,包括 SSH 私鑰。
連更小的 GLM-5.3-Flash 也能把已經公開的 Chrome 漏洞做成可用攻擊鏈。整個過程只需要約 20 分鐘人工介入,模型自己跑了 8 小時。按智譜 API 價格計算,成本只有 20.40 美元。
Anthropic 對 GLM-5.3 的批評主要集中在安全限制。GLM-5.3 面對直接的惡意請求原本會拒絕,但換成虛假的「紅隊測試」背景後,64% 的測試會繼續執行;預填模型思考內容後升到 92%;直接修改開放權重移除拒絕機制後達到 100%。Anthropic 認為,開放權重讓攻擊者可以直接拆掉這些安全限制。
這份報告原本想證明 GLM-5.3 有多危險,傳播效果卻很像競爭對手親自寫了一份性能廣告。美國 NIST 此前也獨立得出類似結論,稱 GLM-5.3 是目前網路安全能力最強的開放權重模型,不過綜合能力仍落後美國前沿模型約 4 個月。
