動察 Beating AI 快訊,智譜共同創始人唐杰發長文複盤 Scaling Law。過去幾年,大模型一釋出,大家最愛問「多少參數」。但在唐杰看來,參數早就不能單獨解釋模型能力。數據有多少、算力花在哪、模型以後怎麼用,同樣重要。
行業已經為此走過一次彎路。2020 年,Kaplan 等人的 Scaling Law 認為,算力增加後,參數應該比訓練數據增長得更快。GPT-3、Gopher、MT-NLG 都沿著這個方向越做越大,行業一路衝向兆參數。
2022 年,Chinchilla 重新做實驗,發現問題恰恰出在這裡。很多大模型做得太大,數據卻喂得不夠。繼續加算力時,參數和數據應該一起增長。唐杰回頭看,那輪兆參數競賽,就是整個行業一起走過、後來又掉頭的彎路。
但 Chinchilla 算的仍然只是訓練這筆賬。模型真正上線後,會被反覆調用,長期推理成本越來越重要。把這部分也算進去,最優方案又會變化。模型可以小一些,再用更多數據訓練得更充分。後來 Llama-2-7B、Gemma-2-9B 等模型,已經在往這個方向走。
再往後,MoE 又把問題變複雜了。總參數更多,通常代表能裝下更多知識;每次真正參與計算的參數和計算深度,則更影響推理能力。兩者不能混為一談。到 2025 年,新的研究進一步發現,不同任務連最合適的 Scaling 方法都不一樣。記憶更吃參數,推理更吃數據;在 MoE 裡,一味增加總參數甚至可能拖累推理,增加實際參與計算的專家反而更有效。
漏洞挖掘就是一個很直觀的例子。發現新漏洞,不是多背幾條 CVE 就夠了。真正難的是把二十步推理一路走到底,中間不能斷。參數多,未必就能想得更深。
GLM-5.3 是唐杰這次拿出的驗證。它和 GLM-5.2 使用同一個基座、同一套架構,總參數和啟動參數都沒變。團隊只繼續訓練了一個月,重點擴大長程任務環境和強化學習,能力依然明顯提升。這一次加的不是參數,而是後訓練。
唐杰最後的判斷很明確。Scaling 遠沒有結束。模型規模、預訓練數據、每次計算投入多少算力、後訓練做多深,都還有空間。只是每一代模型的瓶頸不同,最該加碼的地方也會變。
大模型下一輪競爭,比的可能不再是誰的參數最多,而是誰更知道算力該花在哪。