根據動擊 Beating 監測,蘋果研究團隊拿 9 款模型、11 種語言做了一輪強化學習實驗,想搞清楚:如果訓練數據只有一種語言,模型學到的解題能力能不能拿去做其他語言的題?
答案是,可以,而且效果相當明顯。只用一種語言訓練,模型在很多其他語言上也會一起變強。
比如在法語測試上,直接用法語訓練,成績平均提升 25.6 個百分點;完全不用法語訓練,只拿西班牙語的題來練,最後考法語也能提升 24.6 個百分點,只差 1 個百分點。
模型學到的不只是某一種語言裡的題,還有一部分可以換語言繼續用的解題方法。所以以後想把模型的中文推理練強,未必所有強化學習數據都得重新做成中文。
但訓練語言也不能隨便換,特定語言確實可能觸發特定能力退化。同樣一套強化學習,換一種訓練語言,有些模型在其他語言和任務上反而會明顯退步。最誇張的一組實驗裡,Qwen3-4B 用斯瓦希里語訓練後,一組訓練時沒見過的英語測試比原模型掉了 19.2 個百分點;多語言一起訓練時,這項測試反而提升了 4.5 個百分點。
這篇論文驗證的主要還是數學、邏輯、圖、幾何等答案可以自動判斷對錯的推理題。這些題換一種語言後,底層解法往往沒有變。對於閱讀理解、隱喻、語義判斷、文化知識這些真正依賴語言本身的任務,論文沒有驗證。