header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

DeepSeek發布視覺理解模型,大藍鯨等來遲的眼睛

閱讀本文需 17 分鐘
前方路途不再容许闭着眼睛前行。
原文標題:《DeepSeek發布視覺理解模型,大藍鯨等來遲到的眼睛》
原文作者:動察Beating


2026 年 8 月 21 日,DeepSeek 推出全新的視覺理解模型 deepseek-v4-flash-vision-exp,多模態 API 正式開放。開發者第一次可以把圖片直接送進 DeepSeek 的官方接口。


模型保留了 V4 Flash 的 100 萬 token 上下文和 38.4 萬 token 最大輸出,支持 JSON Output、Tool Calls、Responses API,也兼容 Anthropic API。


價格也完全沿用 V4 Flash。每百萬 token 輸入,緩存未命中時,高峰期 3 元,空閒期 1.5 元;緩存命中分別是 0.1 元和 0.05 元。輸出高峰期 9 元,空閒期 4.5 元。北京每天 9 時至 12 時、14 時至 18 時屬於高峰,其餘 17 個小時半價。


圖片同樣按 token 結算。進入模型前,每張圖片都會根據尺寸自動縮放,小於約 384×384 像素的會被放大,大圖則會被壓到約 800×800 像素的總像素量。單張圖片最多占 384 個 token。一張 2000×2000 的圖片和一張 5000×5000 的圖片,最後可能花掉完全一樣的 token。


按照 384 token 的上限,一張圖片在高峰期、緩存未命中的輸入費用約為 0.001152 元。處理一千張這樣的圖片,圖片輸入本身也只有約 1.152 元,文字和模型輸出另算。


一起上線的還有 Files API。開發者可以提前上傳圖片,再把 file_id 放進請求。同一張圖只需要傳一次,之後可以在不同請求裡反覆引用。


這個 API 本身不收費。單個文件最大 64 MiB,每個用戶最多存 25 GiB、10000 個文件。文件可以設定在 1 小時到 30 天後過期,不設定有效期則可以一直保留。目前官方也沒有提供下載文件內容的接口。開發者可以上傳、查詢和刪除,模型可以讀取。它更像一個專門給推理準備的免費圖片倉庫,而不是普通雲端。


不過奇怪的其實不是 DeepSeek 到今天才會看圖。


兩條時間線


如果只看研究,DeepSeek 的視覺並不晚。


如果只看產品和 API,它又確實晚了很久。


2024 年 3 月 11 日,DeepSeek-VL 開源。


它有 1.3B 和 7B 兩個版本,能看自然圖片、網頁、公式、圖表和文件。到了 10 月,Janus 出現,把圖像理解與生成放進同一套自回歸框架。11 月 13 日,JanusFlow 跟進。12 月,DeepSeek-VL2 發布,換成混合專家架構,總參數量分成 3B、16B 和 27B 三檔。



2025 年 1 月 28 日凌晨,除夕,Janus-Pro 開源。官方倉庫按照 UTC 記在 1 月 27 日。


7B 版本在 GenEval 這項文字生成圖片的指令遵循評測裡拿到 0.80,超過論文所列 DALL-E 3 的 0.67。它有開源權重,可以本地部署,也有公開演示。


DeepSeek 沒有把它接進自己的托管 API。


就在此前一周,R1 已經把 DeepSeek 推到了聚光燈下面。Janus 留在 GitHub 和 Hugging Face。對絕大多數普通用戶來說,它很快又消失在了視野裡。


2025 年 10 月 20 日,DeepSeek-OCR 開源,用視覺 token 壓縮長文檔。2026 年 1 月 27 日,OCR 2 發布。


從 DeepSeek-VL 開始算,兩年裡至少能查到 DeepSeek-VL、Janus、JanusFlow、VL2、Janus-Pro、OCR 和 OCR 2 七條公開記錄。


視覺研究一直在做,也一直往外放。


只是普通開發者一直沒有那個入口。


而另一邊,到 2024 年 3 月,幾家主要競爭對手的開發者介面都已經可以接收圖片。OpenAI 在 2023 年 11 月開放 GPT-4 Turbo with Vision,圖片可以直接進入 Chat Completions API;一個月後,Google 上線 Gemini Pro Vision API;2024 年 3 月,Claude 3 全系加入視覺能力。


2025 年 4 月 25 日,李彥宏在百度 Create 大會上說,「DeepSeek 也不是萬能的」。隨後列出的幾個問題裡,就有模態單一。


他的判斷是,多模態會成為基礎模型的標準配備,純文本模型的市場會越來越小。


那時候,DeepSeek 已經做了一年視覺研究。


凌晨


2026 年 4 月 7 日和 8 日,部分用戶打開 DeepSeek,介面裡突然多出三個入口。


「快速」「專家」「視覺」。



4 月 29 日,DeepSeek 多模態團隊負責人陳小康確認識圖功能開始面向部分用戶灰度。隨後,DeepSeek 一名資深研究員寫道,「小鯨魚現在能看見了」。南華早報直接把這句話放進了標題。


DeepSeek 的眼睛第一次真正從產品介面裡露出來。


第二天,DeepSeek 把《Thinking with Visual Primitives》放上 GitHub。幾個小時以後,倉庫和論文又被撤下。到了 5 月 1 日,原地址已經返回 404。DeepSeek 沒有解釋,網上只剩下論文鏡像和媒體轉述。


論文研究的是一個很具體的問題。


模型看到一張很擁擠的圖片以後,常常知道自己在說什麼,卻說不清自己說的究竟是哪一個人、哪一條線。團隊把點座標和邊界框直接插進推理過程,讓模型一邊指出位置,一邊繼續往下想。


一張 756×756 的圖片先經過視覺編碼器,變成 2916 個圖像塊 token,再通過 3×3 空間壓縮合成 324 個 token。V4 Flash 的稀疏注意力繼續壓縮緩存,最後只留下 81 個視覺 KV 條目。


團隊還為這套方法生成了超過 4000 萬條訓練樣本,其中包括專門訓練迷宮導航和路徑追踪的數據。


這篇論文花了很大力氣解決的,其實是「指哪兒」。


模型先得看見,再得知道自己正在看哪裡。只有這樣,它才能繼續往下推理。


DeepSeek 這次沒有說明 Vision Exp 是否完整沿用了這套 Visual Primitives 方案。更重要的是,這項研究第一次把 DeepSeek 對「視覺推理」的理解暴露在了外面。


6 月 18 日,網頁和 App 的識圖模式正式上線。第二天,有媒體上傳梁文鋒的照片測試,DeepSeek 連續兩次把他認成張一鳴。換一個對話,它又把張一鳴認成寒武紀創始人陳天石。


它已經能讀英文截圖,也能把網頁轉成代碼。


到了人臉面前,卻連自己老闆都認不出來。


8 月 19 日,DeepSeek Harness 留下一份日期明確的技術說明。官方適配器已經能夠把圖片序列化成 image_url,文檔同時寫明,默認模型目錄暫時不會展示 deepseek-v4-flash-vision-exp,需要等對應的 API 端點可用。


8 月 20 日,還有開發者實測發現,給這個尚未開放的模型名傳圖,只會收到 400 錯誤。


8 月 21 日,這個限制被拿掉。Harness 把 deepseek-v4-flash-vision-exp 加進默認模型目錄,對應的合併提交直接寫著「publish the vision model」。隨後,DeepSeek 官方 API 文件和公眾號同時宣布 Vision Exp 上線。


兩條線終於碰到了一起。


Agent


在今年 5 月一場投資者交流會的錄音轉寫裡,梁文鋒把自己理解中的 AGI 路線排成了幾級台階:語言模型、思維鏈、Agent、持續學習、自我迭代,再到具身智能。


多模態被他放在組件的位置,和搜索差不多。


談到視頻生成時,轉寫裡有一句話:


在商業上,它是個好生意。但是這跟智能沒有什麼關係。


他的判斷是,視頻生成、世界模型在當前階段和智能上限的關係沒有那麼大,眼前更要緊的是 AI 訓練,以及訓練之後的持續學習。


多模態不一樣的地方在於,它雖然也被放在「元件」的位置,卻是 DeepSeek 明確說過一定會做的元件。梁文鋒當時還提到,V4 以及後續版本會支援原生多模態。


視覺在 DeepSeek 的路線裡一直有位置,只是排得沒有那麼靠前。


等路線走到第三步 Agent,情況開始有些不一樣了。


DeepSeek 沒有公開說過,這次視覺 API 是「為了 Agent 才上線」。但把梁文鋒對路線的判斷和今天的發布放在一起,兩條線已經很難完全分開看。


Agent 要讀屏幕,要看圖表,要處理工具設回來的截圖。它不可能永遠生活在純文字裡。那些已經做了兩年的視覺能力,也終於從論文、倉庫和測試頁面裡,一路走到了 API。


DeepSeek 今天給 Vision Exp 展示的三個例子也都不是傳統的「看圖說話」:一個 Agent 給高端客戶製作西藏自駕遊 PPT,一個重新設計 DeepSeek Harness 官網,還有一個根據視覺要求製作帶動態效果的前端 Demo。


它們都需要模型在長流程任務裡反覆處理視覺信息。


API 的設計也在往這個方向靠。Responses API 同樣接受 input_image,瀏覽器 Agent 可以拿到網頁截圖以後,把它重新送進下一輪推理;程式碼 Agent 可以檢查渲染結果,圖表、掃描件和軟體介面也能直接成為上下文。


Files API 則解決另一件事:同一張圖不用在每輪請求裡重複上傳。一個檔案可以長期放在那裡,Agent 只需要反覆傳 file_id。單次請求最多還能放 600 張圖片。使用外部連結或 Base64 時,單張圖片上限是 32 MiB,通過 Files API 引用後可以到 64 MiB。


這已經不太像給聊天框加一個「上傳圖片」按鈕。


它更像是在補 Agent 使用視覺時需要的基礎設施。


DeepSeek 公佈的四項多模態 Agent 對比,也很少在考傳統意義上的「看圖說話」。


ApexBench 關注投行、諮詢和法律等長流程任務。Agents' Last Exam 來自 55 個專業領域的真實工作。Chartography 專門考 Kaplan-Meier 曲線、K 線、等高線、桑基圖和波特圖。ZeroBench 則用 100 道人工設計的難題測試多步視覺推理。



Vision Exp 對 Claude Opus 4.8 拿到兩勝兩負。


Agents' Last Exam 是 27.3 對 25.7,ZeroBench 是 35.0 對 34.0。ApexBench 為 36.5 對 39.4,Chartography 為 64.3 對 65.0。四項差距都沒有超過 3 分。


更有趣的是,加上視覺以後,原來的文本 Agent 能力沒有明顯掉下去。


和 7 月 31 日發布的純文本 V4 Flash 逐項比較,官網同時給出前後成績的五項文本 Agent 評測全部上漲。


Terminal Bench 2.1 從 82.7 漲到 83.9,NL2Repo 從 54.2 到 57.7,DeepSWE 從 54.4 到 59.3,DSBench-Hard 從 59.6 到 63.6,AutomationBench 從 25.1 到 25.7。DeepSWE 的 59.3,也超過了圖中 Opus 4.8 的 58.0。


不過,這組數字來自 DeepSeek 自己的測試。官方註明,公開 Code Agent 文本任務中的 DeepSeek 系列模型使用 DeepSeek Harness 極簡模式,推理檔位設為 max。它們更適合用來觀察 Vision Exp 相比自家 V4 Flash 的變化,而不是直接當成第三方獨立排名。


模型名字後面的 exp 也還沒有摘掉。


DeepSeek 明確把它標成實驗模型,版本仍然可能繼續變化。現在的接口只做圖片理解,輸出依然是文字。圖片生成和視頻沒有開放,Files API 也只接受 JPEG、PNG、GIF 和 WebP,PDF 不能直接塞進去。


2024 年,開發者想給 DeepSeek 發一張圖片,官方 API 還接不住。


到 2026 年 8 月 21 日,這張圖片終於進來了。


DeepSeek 的眼睛確實睜開得晚。


等它真正睜開的時候,前面的路已經不允許它繼續閉著眼睛走了。


原文链接


歡迎加入律動 BlockBeats 官方社群:

Telegram 訂閱群:https://t.me/theblockbeats

Telegram 交流群:https://t.me/BlockBeats_App

Twitter 官方帳號:https://twitter.com/BlockBeatsAsia

举报 糾錯/舉報
選擇文庫
新增文庫
取消
完成
新增文庫
僅自己可見
公開
保存
糾錯/舉報
提交