動察 Beating AI 快訊,AI Agent 創業公司 NeoCognition 發布 ApprenticeBench,專門測 AI 能不能像新人一樣,入職後自己學會一份工作。第一版讓 Agent 進入一家模擬的加州建築公司做應付帳款。它先讀半年歷史帳單、公司手冊和 Odoo 教程,再連續處理 7 個月的 100 張帳單,期間還會遇到規則變化和主管反饋。
Fable 5.1 最終成功率达到 72%,GPT-6 Astra 為 68%,最佳人類測試者只有 51%。任務除了錄發票,還包括發現錯誤、分配成本碼、聯繫供應商、走審批,以及從歷史記錄和反饋裡學會公司的內部規則。兩款模型直接操作 GUI 的成績甚至略高於調用 API,過去 Computer Use 常見的性能損失基本消失。
不過,「超過人類」只成立於這一個模擬崗位,而且真人樣本只有 2 個。成本也更高,Fable 5.1 平均每個任務要 18.23 美元,人類約 7.21 美元。人類越做越快,Agent 反而會因為記的東西越來越多而變慢。
