動察 Beating AI 快訊,Inco AI 開源本地推理引擎 Splash,把 Qwen3.8-27B 在 M5 Max MacBook Pro 上跑到了最高 144 Token/s。LM Studio 隨即接入,0.4.25 版本已經可以直接使用。
Inco 此前做出的 DFlash 已經進入 SGLang、vLLM、TensorRT-LLM 和 llama.cpp。Meta、NVIDIA、小米、Poolside 等也給自家模型配了 DFlash 加速小模型。DFlash 會先讓小模型並行猜出多個 Token,再交給大模型批量驗證,減少逐 Token 生成的計算。
Splash 把這種優化擴到了整個本地推理引擎。它目前只支持 Qwen3.8-27B 和 Qwen3.6-35B-A3B,每個模型都單獨配了 GPU kernel、內存方案和 DFlash 2 小模型。覆蓋的模型少,但換來了更激進的性能優化。
144 Token/s 是 M5 Max 上的最高演示值。換到 Inco 用來做橫向測試的 48GB M5 Pro,Qwen3.8-27B 單路短上下文達到 74 Token/s;4 路並發時總吞吐達到 170 Token/s,是第二名的 3.9 倍。這也是 Splash 更適合 Agent 場景的地方。一個 Agent 同時拉起多個子任務時,並發總吞吐往往比單條對話速度更重要。
Splash 本身開源,不綁定 LM Studio。目前需要 M3 或更新的 Mac、macOS 26.4 以上、至少 36GB 統一內存。