動察 Beating AI 快訊,大模型推理/部署框架 SGLang 新增原生決策 API,讓 Qwen3.8-27B 這類現成 LLM 和多模態模型不用改權重、也不用重新微調,就能直接做選擇、判斷和打分。開發者給出當前情況和幾個候選答案,模型直接返回每個選項的機率,不再先生成一段文字再解析。
它利用的是大模型本來就會計算的「下一個 token 機率」。比如候選答案是 A、B、C,普通聊天模型會繼續生成文字;SGLang 則直接讀取模型對 A、B、C 的機率,看看它更傾向哪個答案。模型本身沒變,只是換了一種讀取結果的方式。
SGLang 用 Qwen3.8-27B 做了一個《寶可夢 FireRed》演示。模型根據實時遊戲狀態判斷攻擊、換精靈還是治療,單次決策低於 100ms,並一次打通四天王和冠軍。Qwen3.8-27B 本身支持圖像輸入,所以這套方法也能處理多模態決策。
SGLang 還新增 /v1/systemone 接口,兼容 Jev 使用的 TypeSafe SDK。已經使用這套 SDK 的應用,可以把服務地址改成自己的 SGLang 實例繼續調用。新功能已經進入 nightly 版本,計劃隨 v0.5.21 正式發布。