動察 Beating AI 快訊,阿里千問上線原生全模態模型 Qwen3.8-Omni-Flash,支持文本、圖片、音頻、視頻和 1M 上下文。
這代明顯加強了音視頻 Agent 能力。模型可以自己從視頻裡找信息、規劃任務,再調用外部工具完成剪輯、配音和渲染。官方展示了長會議處理、短劇翻譯、電影解說、MV 製作和視頻轉圖文筆記等場景。
面對幾小時的長視頻,它也不用從頭到尾全部處理。模型會先判斷答案可能在哪,再逐步定位關鍵片段。OmniVideoBench 上,準確率從 63.4 提到 67.8,Token 消耗從 145,736 降到 79,117,少了 45.7%。
千問稱,Qwen3.8-Omni-Flash 在 30 項評測上的平均成績比 Qwen3.5-Omni-Plus 提升超過 26%,音視頻能力接近 Gemini 3.8 Flash,音頻能力整體超過後者。音頻輸入成本下降超過 98%,音視頻輸入下降超過 93%。
目前 Qwen3.8-Omni-Flash 模型權重尚未公開,只開放了 API。千問同時開源了 Qwen-MM-Plugins,可以裝進 Claude Code、Codex、Gemini CLI、Qwen Code 等 Agent,給它們補上圖片、音頻、長視頻處理和視頻剪輯能力。
另一套 Qwen-Live Harness 更像實時調度層。用戶可以直接和實時全模態模型說話,再把複雜任務交給 Gemini CLI、Claude Code、Codex 等後台 Agent 持續執行。它會跟蹤任務進度,做完後再主動回來告訴你結果。