動察 Beating AI 快訊,Jina AI 發布文檔解析模型 jina-ocr-v1,可以把 PDF、掃描件、表格和圖表直接轉成 Markdown。它基於 DeepSeek-OCR 做後訓練,沿用其約 34 億總參數、解碼時每個 Token 激活約 5.7 億參數的 MoE 架構,並加入 FastMTP 推測解碼。
Jina 自測中,jina-ocr-v1 在 OmniDocBench v1.6 得 91.14,比 DeepSeek-OCR-2 高 0.89 分;在 olmOCR-Bench 得 83.4,比它實際基於的 DeepSeek-OCR 底模高 7.4 分。
吞吐量是 Jina 主打的賣點之一。單張 A100、併發 32 時,它達到 2.57 頁/秒,在 Jina 測試的 14 個系統中最高,比 DeepSeek-OCR 的 2.10 頁/秒高約 22%。
模型權重已經放上 Hugging Face,採用 CC BY-NC 4.0,商業使用需要聯繫 Jina。