header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

Cua Driver給Agent補上「眼睛」:純像素界面也能識別按鈕和文字

動察 Beating AI 快訊,開源 Computer Use 工具 Cua 給 Cua Driver 加入可選的 Perception 視覺擴展。Driver 原本優先透過網頁結構和系統無障礙樹找按鈕。遇到 Canvas、遊戲、遠端桌面或自繪應用時,這些結構可能為空。Perception 會直接讀取截圖,把畫面拆成帶文字、類型和位置的區域,供 Agent 繼續操作。


首版用 OmniParser 識別圖標和控件,用 PP-OCR 讀取文字。整個解析過程在本機 CPU 完成,不需要 GPU,也不把截圖發到網路。官方實測單張截圖在 macOS 約需 2 至 2.5 秒,Linux 為 3.5 至 4 秒,Windows 為 8 至 9 秒。它主要在頁面結構和無障礙樹失效時兜底,不會預設每一步都跑視覺解析。


Cua 還限制了視覺操作對舊截圖的復用。每次視覺識別都會綁定當前截圖的 `capture_id`,隨後點擊必須來自同一張截圖。截圖超過 60 秒,或者已經執行過一次操作,Driver 就會拒絕繼續使用,避免界面變化後還拿舊座標誤點。


Cua 過去其實已經能透過 `cua-som` 和 OmniParser 做視覺定位。現在這套能力被直接接進 Cua Driver,上層 Agent 可以透過統一接口拿到識別結果。即使模型本身不會看圖,也可以根據這些文字和區域資訊決定下一步操作。


Perception 不是預設組件,其中 OmniParser 檢測器採用 AGPL-3.0;Cua Driver 仍保持 MIT 協議。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成