header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

Banbury Road讓32個模型一起練,自己形成不同專長

動察 Beating AI 快訊,AI 實驗室 Banbury Road 發布 Kardashev-0.7,由 32 個不同模型組成。團隊用強化學習一起訓練這些模型,不提前規定各自負責什麼,讓它們在訓練中形成不同專長和互補能力。這套方法被稱為 RL for Population Scaling(RLPS)。


此前的 RLPS 實驗最多做到 16 個模型。在 8 模型實驗中,共同訓練後的模型群體得分為 81.70%,高於 8 個獨立訓練模型的 71.04%,也高於同一個模型重複採樣 8 次的 72.65%。在 16 模型實驗中,有 22 道題只有其中 1 個模型答對,說明不同模型確實學出了不同能力。


Kardashev-0.7 把規模擴大到 32 個模型。Banbury Road 稱,它能以 0.007 至 0.02 倍的推理成本、0.03 倍的記憶體達到前沿模型級表現。目前 API Beta 仍需要加入候補名單。


不過,此前 8 和 16 模型實驗裡的群體成績,是事後用標準答案從多個模型輸出中選出最好結果。實際使用時沒有標準答案,系統怎麼自動挑出正確回答,Banbury Road 還沒有公開完整方案。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成