動察 Beating AI 快訊,英偉達發布文章稱,阿里巴巴最新預覽模型 Qwen3.8-Flash-Next 已獲得英偉達 GB300 NVL72 平台支持。該模型總參數規模達 1760 億,每 Token 激活約 60 億參數,原生支持 26.2 萬 Token 上下文,並可通過 YaRN 擴展至 100 萬 Token,主要面向智能編程、文檔處理及工具調用等長上下文 Agent 應用。
英偉達表示,Qwen3.8-Flash-Next 採用 Gated DeltaNet(GDN)與 Qwen Sparse Attention(QSA)混合架構,以降低長上下文場景下的計算和 KV 緩存開銷。測試顯示,在 GB300 NVL72 上,該模型單 GPU 吞吐量超過 1.6 萬 Token/秒,單用戶吞吐超過 200 Token/秒;同時支持 SGLang、vLLM 及 TensorRT-LLM 等推理框架。