動察 Beating AI 快訊,法國 AI 公司 H Company 發布 Computer Use 模型 Holo4,包括 27B 和 35B-A3B 兩個版本。前者基於 Qwen3.8 dense 架構,後者基於 Qwen3.5 MoE 架構繼續做後訓練。
H Company 主要強化了電腦操作和長任務執行能力,把原本的通用模型進一步訓成面向 Computer Use 的 Agent 模型。
監督微調階段,H Company 一共用了 1270 億 tokens,其中約四分之三是成功完成任務的 Agent 操作軌跡,覆蓋桌面、網頁、手機、MCP 和 API。隨後又做強化學習,分別訓練「桌面和網頁」與「終端、MCP 和 API」兩類專家能力,再合回同一個模型。公司還自己生成了約 1 萬個軟體操作任務,用來訓練跨應用和長流程工作。
H Company 還重做了 Agent harness,讓模型在數百步任務裡持續記住前面的操作,並可以直接調用電腦上的 shell。
效果主要體現在長任務上。Holo4 27B 在 OSWorld 2.0 得到 61.7%,Qwen3.8-27B 官方成績為 48.0%;在普通 OSWorld 上,Holo4 為 85.2%,Qwen3.8-27B 則為 84.3%。不過這些成績的 harness、任務版本和評測設置並不完全一致,不能當成嚴格的同條件對照。