動察 Beating AI 快訊,AI Agent 可觀測性平台 Laminar 發布專門檢查 Agent 執行軌跡的模型 flow-1。它會讀取模型調用、工具調用和返回結果,找出 Agent 在哪一步出錯、為什麼出錯。
flow-1 運行在 Laminar 的 Signals agent 中。模型可以搜索整條 trace(Agent 的完整執行記錄),再按需查看具體步驟。訓練時,Laminar 先用合成調查數據做監督微調,再通過強化學習訓練工具調用和複雜 trace 分析。
在 Laminar 自建的 523 條困難 trace 測試中,flow-1 的錯誤檢測 F1 為 0.835,GPT-6-sol 為 0.816。sol 召回率更高,能找到更多真實錯誤;flow-1 精確率更高,誤報更少。
對於不足 10 萬 LLM tokens 的 trace,flow-1 平均每條分析約 0.0011 美元,GPT-6-sol 約 0.026 美元。按 Laminar 測算,1 美元分別能分析約 888 條和 38 條 trace,相差約 23 倍。flow-1 的成本也比 GPT-6-luna 低約 25%。
目前這些成績都來自 Laminar 自建 benchmark,暫無第三方復測。flow-1 的訓練數據主要來自合成工作流,其中約 48% 是軟件工程任務。社區已經有人質疑,它面對真實生產環境裡沒有預先設計過的新型故障時能否保持同樣表現。