header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

Jina魔改DeepSeek-OCR,自測14款裡頁面吞吐第一

動察 Beating AI 快訊,Jina AI 發布文檔解析模型 jina-ocr-v1,可以把 PDF、掃描件、表格和圖表直接轉成 Markdown。它基於 DeepSeek-OCR 做後訓練,沿用其約 34 億總參數、解碼時每個 Token 激活約 5.7 億參數的 MoE 架構,並加入 FastMTP 推測解碼。


Jina 自測中,jina-ocr-v1 在 OmniDocBench v1.6 得 91.14,比 DeepSeek-OCR-2 高 0.89 分;在 olmOCR-Bench 得 83.4,比它實際基於的 DeepSeek-OCR 底模高 7.4 分。


吞吐量是 Jina 主打的賣點之一。單張 A100、併發 32 時,它達到 2.57 頁/秒,在 Jina 測試的 14 個系統中最高,比 DeepSeek-OCR 的 2.10 頁/秒高約 22%。


模型權重已經放上 Hugging Face,採用 CC BY-NC 4.0,商業使用需要聯繫 Jina。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成