据動察 Beating 監測,工作流自動化平台 Zapier 與評測機構 Artificial Analysis 合作,推出了獨立的 SaaS 工作流自動化評測基準 AutomationBench-AA。
基準基於 Zapier 平台上的真實脫敏數據,設計了包含 657 個多步驟任務和 40 個模擬 SaaS 軟體環境(包括 Gmail、Slack、Salesforce、Jira 等)的私有測試集,進行客觀的第三方評估。
測試的嚴苛之處在於引入了安全合規紅線(Guardrails)。大模型必須在不違反任何預設企業業務規則的前提下完成操作,如果在執行過程中觸發了任何合規違規,任務的最終得分將直接清零。首期評測中,大模型普遍因為合規防線懲罰而得分骤降,最終得分無一過半。
其中,引入「高難任務回退至 Opus 4.8(佔比約 18%)」安全降級機制的 Claude Fable 5 在純任務步驟上實際完成了 73% 的目標,但綜合得分僅為 48.6%;Gemini 3.5 Flash 與 GPT-5.5 雖然也完成了近七成(分別為 68% 和 67%)的目標,但最終得分跌至 42.6% 與 42.1%。開源領頭羊 GLM-5.2 則僅得 27.8%。
測試表明,模型在自動操作中如何堅守安全防線,已成為實戰落地的關鍵挑戰。