動察 Beating AI 快訊,GitHub 給 Copilot 加了一個多模型編排系統 HydraFusion。它先判斷任務該怎麼做,再調用不同模型。
目前有三種方式:簡單任務交給一個模型直接完成;複雜任務先讓成本更低的模型嘗試,結果不過關再升級到更強模型;需要複核時,則讓一個模型先做,另一個不同家族的模型專門挑錯,再讓第一個模型修改。
GitHub 在三個編程 Agent 基準上拿它和 Claude Opus 5 對比。TerminalBench 2.1 高出 4.9 個百分點,DeepSWE 低 1.5 個百分點,CheckpointBench 只低 0.1 個百分點,基本持平;成本則分別降低 67%、36% 和 65%。
這個思路很像 Sakana AI 的 Fugu。兩者都是把「選哪個模型」進一步變成「怎麼組織多個模型」。區別是 Fugu 本身就是一個訓練出來的指揮模型,會學習怎麼調用不同 Agent,甚至能遞歸調用自己;HydraFusion 目前仍然是在 Single、Cascade、Critique 三種固定執行模式裡選擇,更像把多模型調度直接塞進 Copilot。
HydraFusion 已向所有 GitHub Copilot 套餐開放研究預覽,目前需要在 Copilot CLI 的實驗功能中開啟。GitHub 也提醒,現階段最適合一次說清楚的單輪編程任務,多輪長任務還在繼續優化。