header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

Qwen3.8-Omni-Flash上線:自己看影片、調工具、交成片

動察 Beating AI 快訊,阿里千問上線原生全模態模型 Qwen3.8-Omni-Flash,支持文本、圖片、音頻、視頻和 1M 上下文。


這代明顯加強了音視頻 Agent 能力。模型可以自己從視頻裡找信息、規劃任務,再調用外部工具完成剪輯、配音和渲染。官方展示了長會議處理、短劇翻譯、電影解說、MV 製作和視頻轉圖文筆記等場景。


面對幾小時的長視頻,它也不用從頭到尾全部處理。模型會先判斷答案可能在哪,再逐步定位關鍵片段。OmniVideoBench 上,準確率從 63.4 提到 67.8,Token 消耗從 145,736 降到 79,117,少了 45.7%。


千問稱,Qwen3.8-Omni-Flash 在 30 項評測上的平均成績比 Qwen3.5-Omni-Plus 提升超過 26%,音視頻能力接近 Gemini 3.8 Flash,音頻能力整體超過後者。音頻輸入成本下降超過 98%,音視頻輸入下降超過 93%。


目前 Qwen3.8-Omni-Flash 模型權重尚未公開,只開放了 API。千問同時開源了 Qwen-MM-Plugins,可以裝進 Claude Code、Codex、Gemini CLI、Qwen Code 等 Agent,給它們補上圖片、音頻、長視頻處理和視頻剪輯能力。


另一套 Qwen-Live Harness 更像實時調度層。用戶可以直接和實時全模態模型說話,再把複雜任務交給 Gemini CLI、Claude Code、Codex 等後台 Agent 持續執行。它會跟蹤任務進度,做完後再主動回來告訴你結果。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成