据 動察 Beating 監測,OpenAI 研究員 Noam Brown 發表觀點指出,隨著 AI 模型性能的提升,衡量模型好壞的基準測試分數,正逐漸被推理時算力(即模型回答問題時消耗的計算資源)主導。單一的靜態分數已經無法體現強模型的真實水平,未來的評估標準需要轉向以推理算力或生成 Token 數量為橫軸的性能擴展曲線。
Noam Brown 以新模型 GPT-5.5 的測試過程為例,在最初的常規測試中,GPT-5.5 相比 GPT-5.4 優勢並不明顯。然而,一旦分配了更多的推理算力,GPT-5.5 的表現便迎來爆發式增長。如果限制了運行預算,標準測試就無法反映前沿模型的真實上限。類似的性能擴展表現已被多項外部評估所證實。在 Andrej Karpathy 的智能體自主研究實驗,以及英國 AI 安全研究所的惡意網絡測試中,隨著推理預算的增加,GPT-5.5 與 Mythos 模型的表現持續走高,即使在生成超過 100M 個 Token 後依然沒有觸及天花板,且越強大的模型在投入更多算力時性能提升越顯著。
推理算力的提升也讓安全評估變得更加複雜。Noam Brown 警示稱,目前的生物或網絡安全評測通常沒有固定推理預算。在國家級對手為特定任務投入超過 1000 萬美元推理預算時,原本看似安全的模型可能跨越危險紅線。大模型廠商發布新模型時應主動公開以 Token 數量、算力成本或運行時間為橫軸的性能曲線,評測機構也需要將推理預算列為評估的核心變量,在安全評估中通過低算力測試向外推算安全邊界。