header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

AI商戰評測:GPT積極交易,Haiku只畫大餅,Kimi忙碌卻沒賺錢

動察 Beating 監測,Sakana AI 聯合 KPMG 日本 Azsa 審計公司推出多智能體長周期經濟學評測基準 CoffeeBench,通過模擬真實商業環境來檢驗大模型的長期決策能力。傳統的評測大多只讓單個模型在靜態環境中執行任務,CoffeeBench 則構建了一個需要多方博弈與談判的動態市場。論文已被 ICML 2026 智能體失效模式工作坊(ICML 2026 Workshop Failure Modes in Agentic AI) 收錄。

評測模擬了一個由 2 家咖啡農、2 家烘焙商和 2 家零售商構成的咖啡供應鏈體系。在評測中,受試模型負責運營 1 家烘焙商,在 90 天的模擬周期內,通過發送消息、報價交易、支付帳單和賒賬結算等工具自主維持營運。如果智能體消極應對,每日產生的固定成本將迅速耗盡流動資金,迫使大模型像真實企業一樣精打細算。

多款主流大模型的橫向評測展現出了截然不同的「商戰性格」。GPT-5.5 與 Claude Opus 4.7 表現為「積極溝通型」,頻繁與上下游談判價格並高頻撮合訂單以擴大銷售;Gemini 3.1 Pro 屬於「被動響應型」,極少主動發信,但會高頻查閱並響應交易對手盤的信息;Kimi K2.6 雖然工具調用極為頻繁,但由於缺乏合理的定價紀律與談判策略,陷入了「高流水、零利潤」的忙碌陷阱。

最令人意外的是 Claude Haiku 4.5 表現出的「拖延症」停滯現象。推論日誌表明,Claude Haiku 4.5 能夠制定出完美的商業策略,並清醒意識到需要低價採購原材料以應對市場需求,但在執行工具時卻反復選擇待機命令(wait_for_next_day)。規劃與執行的嚴重脫節導致商業活動完全停擺,使模型在固定成本消耗下陷入巨額虧損。

評測還嘗試對智能體施加極端的銷售目標壓力。儘管目前大模型尚未進化出通過虛假循環交易(circular trading)虛增銷售額的認知,但研究指出,隨著長期規劃與協同能力提升,智能體未來完全有可能為了業績壓力而走向經濟違規。如何審計並防範智能體在經濟活動中的違規與欺詐,將成為安全治理的全新課題。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成