摘要
Jina-OCR-v1(arXiv 2609.03181,9 月 4 日周五 digest;Jina AI,合著者韩霄)是文档解析模型:结合 DeepSeek-OCR 式压缩视觉编码器、3B MoE 解码器(每 token 约激活 5.7 亿参数),以及 FastMTP 推测解码头——单个 draft block 在 K=3 个预测步间递归复用;贪婪验证保证解码无损。后训练包含指令对齐、鲁棒性微调,以及用密集可验证奖励做 GRPO(确定性的公式 / 表格 / 结构检查,给部分分)。得分:OmniDocBench v1.6 91.14、olmOCR-Bench 83.4,吞吐 2.57 页/秒(其对比中最高);FastMTP 让 NVIDIA L4 上的解码速度翻倍。模型已在 Hugging Face 公开。
为什么重要
这是一份完整可部署的生产配方,面向几乎每条 RAG 流水线都依赖的工作负载:单张 L4 级 GPU 上 2.5+ 页/秒的文档解析,且整个后训练栈(MoE + MTP + 密集奖励 GRPO)有文档、权重公开。正在付 OCR API 账单的团队,可以拿它对照基准做自托管替代方案。
技术细节
| ArXiv | 2609.03181,2026 年 9 月 4 日周五 digest 宣告 |
|---|---|
| 架构 | 压缩视觉编码器(DeepSeek-OCR 式)+ 3B MoE 解码器(每 token 约 0.57B 激活)+ FastMTP 推测解码头(单个 draft block 跨 K=3 步递归复用,贪婪无损验证) |
| 后训练 | 指令对齐 + 鲁棒性微调 + 密集可验证奖励 GRPO(确定性公式 / 表格 / 结构检查,部分给分) |
| 结果 | OmniDocBench v1.6 91.14;olmOCR-Bench 83.4;2.57 页/秒(其对比最高);FastMTP 在 NVIDIA L4 上解码翻倍 |
| 可用性 | 模型公开于 HF jinaai 组织 |
标签
ocrdocument-parsingmoespeculative-decodinggrpoopen-weightsrag