阿里巴巴开源 0.8B 参数文档解析模型 OvisOCR2,登顶 OmniDocBench 基准
7 月 24 日,阿里巴巴宣布开源文档解析模型 OvisOCR2。该模型仅 0.8B 参数规模,却在文档解析基准 OmniDocBench v1.6 评估中以 96.58 的综合得分登顶,成为首个全面超越传统流水线方法的端到端文档解析模型。
文档解析是 RAG 检索、智能问答与企业知识库的核心基础设施。长期以来,该领域由"版面分析+内容识别"的流水线模式主导,存在维护成本高、误差逐级累积、部署复杂等瓶颈。基于 Qwen3.5-0.8B 后训练的 OvisOCR2 突破了上述限制,单模型一次生成即可按自然阅读顺序输出包含文本、公式、表格与视觉区域的 Markdown 表示。
技术层面,OvisOCR2 结合真实与合成数据,通过监督微调(SFT)、强化学习(RL)、在线策略蒸馏(OPD)及模型融合四种手段,充分释放紧凑模型的潜力。
目前,OvisOCR2 已基于 Apache 2.0 协议在 Hugging Face 及魔搭社区开源,兼容 vLLM 等主流推理框架,可无缝接入千问生态。凭借小参数高效能的优势,该模型显著降低了高精度文档解析的显存与算力门槛,推动文档智能从复杂系统工程向高效模型驱动演进。