IT之家 7小时前
阿里开源 0.8B 文档解析模型,端到端模型首次超越流水线方法
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

IT 之家消息,今日,阿里云开源发布文档解析模型 OvisOCR2。该模型以 96.58 的综合得分刷新 OmniDocBench v1.6 榜单纪录,成为首个超越流水线方法并登顶该榜单的端到端模型,官方称 " 这是文档解析领域迎来技术路线的重要突破 "。

端到端模型首次超越流水线方法

IT 之家从官方公告获悉,文档解析是大模型落地的关键基础设施,企业知识库、RAG 检索、智能问答等场景均需将 PDF、扫描件等非结构化文档转化为结构化文本。

此前该领域由 " 流水线方法 " 主导,通常由版面分析模型和内容识别模型两部分组成,前者负责识别文档布局,后者负责文字、公式、表格等内容的识别,最后拼接输出。这种方式虽成熟,但存在维护成本高、误差累积、部署复杂等固有瓶颈。

OvisOCR2 采用端到端技术路线:输入一张文档图像,模型在一次生成中输出符合自然阅读顺序的 Markdown 表示,覆盖文本、公式、表格和视觉区域。过去需要多个模型协作完成的工作,现在由一个模型一步到位。

在 OmniDocBench v1.6 上以 96.58 分登顶,首次证明端到端模型可超越流水线方法。

小参数大能力,0.8B 实现 SOTA

OvisOCR2 由 Qwen3.5-0.8B 后训练得到。团队构建了真实文档与合成文档互补的数据引擎体系,合成文档专门补充表格与公式交织、多栏版式、长输出等复杂场景。训练方案融合监督微调(SFT)、强化学习(RL)、在线策略蒸馏(OPD)和模型融合四阶段流程,形成多阶段递进式的训练流程,充分释放紧凑模型的潜力。

▲ OvisOCR2 数据引擎体系

项目已开源发布,无缝融入千问生态

OvisOCR2 以 Apache 2.0 许可证开源,兼容 vLLM 等主流推理框架,与 Qwen3.5 推理生态衔接,开发者无需额外适配即可集成。

Hugging Face

魔搭

技术报告

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

开源 公式 it之家 阿里云 阅读
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论