技术路线新突破:阿里云开源发布0.8B文档解析模型OvisOCR2
3 小时前 / 阅读约2分钟
来源:凤凰网
阿里云发布文档解析模型OvisOCR2,刷新OmniDocBench榜单纪录,成为首个登顶该榜单的端到端模型,采用端到端路线,输入文档图像后一次性输出Markdown格式结果,已开源并兼容主流推理框架。

凤凰网科技讯 7月24日,阿里云正式开源发布文档解析模型OvisOCR2。该模型以综合得分96.58刷新OmniDocBench v1.6榜单纪录,成为首个超越传统流水线方法并登顶该榜单的端到端模型,标志着文档解析领域迎来重要技术路线突破。

此前文档解析领域由“流水线方法”主导,需依次调用版面分析、文字识别等多个模型,存在维护成本高、误差累积等问题。OvisOCR2采用端到端路线:输入文档图像后,模型一次性输出符合自然阅读顺序的Markdown格式结果,覆盖文本、公式、表格和视觉区域,一个模型完成过去多模型协作的工作。

该模型由Qwen3.5-0.8B后训练得到,仅0.8B参数量即实现SOTA性能。训练采用监督微调、强化学习、在线策略蒸馏和模型融合四阶段流程,并构建了真实与合成文档互补的数据引擎体系,以充分释放紧凑模型潜力。OvisOCR2已以Apache 2.0许可证开源,兼容vLLM等主流推理框架,可与Qwen3.5生态无缝衔接。