動察 Beating AI 快訊,開源 Computer Use 工具 Cua 給 Cua Driver 加入可選的 Perception 視覺擴展。Driver 原本優先透過網頁結構和系統無障礙樹找按鈕。遇到 Canvas、遊戲、遠端桌面或自繪應用時,這些結構可能為空。Perception 會直接讀取截圖,把畫面拆成帶文字、類型和位置的區域,供 Agent 繼續操作。
首版用 OmniParser 識別圖標和控件,用 PP-OCR 讀取文字。整個解析過程在本機 CPU 完成,不需要 GPU,也不把截圖發到網路。官方實測單張截圖在 macOS 約需 2 至 2.5 秒,Linux 為 3.5 至 4 秒,Windows 為 8 至 9 秒。它主要在頁面結構和無障礙樹失效時兜底,不會預設每一步都跑視覺解析。
Cua 還限制了視覺操作對舊截圖的復用。每次視覺識別都會綁定當前截圖的 `capture_id`,隨後點擊必須來自同一張截圖。截圖超過 60 秒,或者已經執行過一次操作,Driver 就會拒絕繼續使用,避免界面變化後還拿舊座標誤點。
Cua 過去其實已經能透過 `cua-som` 和 OmniParser 做視覺定位。現在這套能力被直接接進 Cua Driver,上層 Agent 可以透過統一接口拿到識別結果。即使模型本身不會看圖,也可以根據這些文字和區域資訊決定下一步操作。
Perception 不是預設組件,其中 OmniParser 檢測器採用 AGPL-3.0;Cua Driver 仍保持 MIT 協議。