動察 Beating AI 快訊,獨立評測項目 Assistant Benchmark 開始用真實任務橫評個人 AI 助手。它直接讓 Agent 訂酒店、選餐廳、買東西、回郵件、連接第三方服務,再按實際完成情況打分。每個評分維度都有一個公開的固定任務,並要求有真實運行記錄才給分。
目前 Muse 在已經完成的 7 個評分維度中平均 9.1 分,暫列第一;Instinct 測完 11 個維度,平均 8.4 分;Grok Bot 測完 7 個維度,平均 7.3 分。Muse 在購物、郵件和第三方應用連接上都拿到 10 分。
不過這更適合看成一份持續更新的真實體驗榜。Muse 的 9.1 目前只是已測 7 個維度的平均分,並不是完整成績。每個維度目前也只用在一個固定任務測試,後續補測後分數和排名都可能變化。