header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

個人Agent也有實戰榜了:Muse暫列第一,領先Instinct和Grok Bot

動察 Beating AI 快訊,獨立評測項目 Assistant Benchmark 開始用真實任務橫評個人 AI 助手。它直接讓 Agent 訂酒店、選餐廳、買東西、回郵件、連接第三方服務,再按實際完成情況打分。每個評分維度都有一個公開的固定任務,並要求有真實運行記錄才給分。


目前 Muse 在已經完成的 7 個評分維度中平均 9.1 分,暫列第一;Instinct 測完 11 個維度,平均 8.4 分;Grok Bot 測完 7 個維度,平均 7.3 分。Muse 在購物、郵件和第三方應用連接上都拿到 10 分。


不過這更適合看成一份持續更新的真實體驗榜。Muse 的 9.1 目前只是已測 7 個維度的平均分,並不是完整成績。每個維度目前也只用在一個固定任務測試,後續補測後分數和排名都可能變化。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成