据動察 Beating 監測,谷歌將電腦操控(Computer Use)功能作為內置工具,直接整合進主力大模型 Gemini 3.5 Flash。
在原生整合前,開發者必須調用專門的 Gemini 2.5 電腦操控模型才能執行代理任務。原生集成後,開發人員與企業用戶能夠直接通過 Gemini API 或谷歌雲 Gemini 企業智能體平台(Gemini Enterprise Agent Platform,即原 Vertex AI 平台)讓主力模型操控設備,簡化了智能體(Agent)開發架構。
內置的電腦操控工具通過接收瀏覽器、移動端或桌面環境的螢幕截圖,進行視覺感知與步驟推理,隨後輸出滑鼠點擊、鍵盤輸入、滾輪滾動及選單導航等操作指令,用以完成軟體持續測試、跨網頁數據收集等長流程自動化任務。為了方便調試與審計,模型生成指令時會附帶「意圖」(intent)字段,用以說明每一步操作的邏輯。
針對智能體在真實網路環境中可能遭遇的提示詞注入風險,谷歌對模型進行了定向對抗訓練,並提供兩項可選防護:涉及資金支付、檔案刪除等不可逆操作時強制引入人工核准;截圖中若發現間接注入指令則自動熔斷任務。
目前,Browserbase 提供了線上托管演示環境(gemini.browserbase.com),谷歌官方也同步在 GitHub 開源了名為 computer-use-preview 的參考實現代碼。