7月24日,阿里巴巴宣布开源发布仅0.8B参数规模的文档解析模型OvisOCR2。在权威文档解析基准OmniDocBench v1.6评估中,该模型以96.58的综合得分登顶。该模型成为首个全面超越传统流水线方法的端到端文档解析模型。基于Qwen3.5-0.8B后训练,OvisOCR2仅凭单模型一次生成即可按自然阅读顺序输出包含文本、公式、表格与视觉区域的Markdown表示。在技术实现上,模型结合真实与合成数据互补的技术路径,并通过监督微调(SFT)、强化学习(RL)、在线策略蒸馏(OPD)及模型融合四大手段进行训练。目前,OvisOCR2已基于Apache2.0协议在Hugging Face及魔搭社区全面开源,兼容vLLM等主流推理框架,可接入千问生态。
网友评论