動察 Beating AI 快訊,Claude Code 負責人 Boris Cherny 發文稱,GPT-6 Astra 的提示詞注入防護已經和 Gemini Flash、Claude Opus 4.8「差不多」,還順手誇了自家 Claude 模型大約兩個月前已「在實踐中解決」這個問題。提示詞注入就是把惡意指令藏進網頁、文檔等內容,誘導 Agent 洩露數據或執行危險操作。
Boris 還稱,公開評估並點名其他實驗室,是推動它們訓練出更安全模型的好辦法,「我們會繼續這樣做,直到其他實驗室更加重視安全」。
貼文很快被 X 加上 Community Note 反駁。Gray Swan 的獨立評測顯示,沒有任何受測模型完全免疫提示詞注入,Claude 同樣存在攻擊成功案例。另一名安全研究員還用特製網頁攻擊 Claude Code Opus 5 Auto Mode,在小規模測試中取得 60%–80% 的成功率。
OpenAI 核心產品負責人 Thibault Sottiaux 隨後直接照著 Boris 的句式反寫了一遍。他稱自己也很高興看到 Claude Code 新出的後台電腦操作終於追上 Codex,「而且是我們今年 5 月的版本」。
Boris 後來承認,原帖「比自己想要的更陰陽」,強調自己確實是在認真肯定 Astra 的進步。他同時澄清,所謂提示詞注入已經「解決」,指的是 Claude 模型、注入檢測機制和 Auto Mode 組合起來後的產品效果,不是模型本身已經免疫。