動察 Beating AI 快訊,Prime Intellect 發布開源模型推理服務 Prime Inference。
用戶可以直接按需調用模型;如果任務需要長期穩定運行,也可以提前鎖定一部分推理算力。接口兼容 OpenAI API,首個公開部署的模型是 GLM-5.3。
這套系統此前已經在 Prime Intellect 內部使用。官方稱,它每天處理接近 1 萬億 tokens,用於強化學習、合成數據、模型評測和 Coding Agent。Prime Intellect 從今年 1 月起也一直在為客戶運行大規模部署。
Prime Inference 重點優化 Agent 的長上下文負載。它把提示詞處理和生成回覆分到不同 GPU 上,測試中將 p90 token 間延遲降低近 40%。Prime Intellect 還壓縮了 KV 緩存,相同顯存下,每個解碼器可緩存的 token 從 109 萬增加到 163 萬,提升約 50%。
Prime Intellect 此前已經提供強化學習、評測和沙箱等訓練基礎設施。加入推理服務後,它可以把模型訓練和實際部署接到同一套平台裡,實際運行產生的數據也可以繼續用於後續訓練。