智猩猩AI整理
论文作者投稿
一个文档中,有正文、标题、表格、公式,也可能夹着印章、手写字和复杂排版。
过去,要把它们准确地识别和理解,往往意味着更大的模型、更高的显存,以及更复杂的工程链路。
效果越来越强,但真正落到业务里,团队最先碰到的往往是三个问题:
没有高端 GPU,能不能先跑起来?
批量处理文档时,速度和成本能不能控制?
换到文字识别或文档问答等其他任务,是否又要从头搭一套视觉模型?
为此,华科联合金山办公开源了MonkeyOCRv2,把“轻量”做进视觉底座本身,包括低参数量预训练、CPU适配、以及基于DFlash的推理加速。该模型以 17 语种文档解析开源榜单第一的成绩证明了其可用性。
![]()
论文题目:
MonkeyOCRv2: A Visual-Text Foundation Model for Document AI
它不是一个只负责输出文字的传统 OCR 工具,而是一个面向 Document AI 的视觉—文本基础模型。
其视觉编码器可以独立使用,也可以接入文档解析、文档理解、文字识别、公式识别、文本检测等不同系统。
![]()
1、28M起步,一套底座覆盖多种任务
![]()
这里的“小”,并非是把能力压缩到单一场景,而是让底座可以按任务选择:识别与理解可从28M的S版(ViT-S架构)起步;偏检测、分割的任务,则可选择21M的AS版(ViTAEv2-S架构)。
)几行代码就能加载一个文档原生视觉编码器。对于已有识别器、检测器或多模态系统的项目,这意味着不必推翻整个系统,只需把 MonkeyOCRv2 作为新的视觉 Backbone 接进去。
轻量的价值,也不只体现在视觉编码器上。完整的文档解析模型同样控制在较小规模:
MonkeyOCRv2-S-Parsing:总参数量约0.6B,其中视觉部分约 0.03B;
MonkeyOCRv2-B-Parsing:总参数量约0.7B,其中视觉部分约 0.1B。
在官方 MDPBench 结果中,B-Parsing 面向 17 种语言、数字原生文档和拍摄文档取得 83.3 的综合分数。
轻量并不等于只面向“干净扫描件”:真实拍照、多语言混排等复杂输入,同样在它的适用范围中。
2、DFlash,单页解析实测加速超过 2.2×
模型变小之后,推理链路还能不能继续提速?MonkeyOCRv2-Parsing基于DFlash。
DFlash是一种推测解码技术,先由配套的轻量 Draft 模型并行提出一组候选 token,再交给目标模型并行验证。
相比目标模型逐 token 生成,这种“先提议、再批量核验”的方式可以减少生成过程中的串行等待。
官方发布说明在实际vLLM部署服务时,推理速度最高可提升约2×。而在4090实机上进行单页解析对比实验,DFlash在两个文档解析基准上都实现了超过2.2×的加速:
单页解析基准 DFlash实测加速比
OmniDocBench 2.25×
MDPBench 2.25×
也就是说,在对应实验条件下,原本完成 1 页解析的时间,使用 DFlash 后可以压缩到约 44%。
开启方式只比普通服务多一个 Draft 模型参数:
python serve.py -m ../model_weight/MonkeyOCRv2-B-Parsing -d ../model_weight/MonkeyOCRv2-B-Parsing-DFlash -p 8888python serve.py -m ../model_weight/MonkeyOCRv2-B-Parsing -d ../model_weight/MonkeyOCRv2-B-Parsing-DFlash -p 8888对于批量 PDF 解析等吞吐敏感的场景,这类加速带来的不只是更少的等待时间,更意味着使用相同的硬件在单位时间内处理更多数据,极大提升实际的部署效率。
![]()
3、没有GPU,也能在CPU上把流程跑通
轻量化真正降低门槛的一步,是CPU支持。
MonkeyOCRv2 已提供 MonkeyOCRv2-Parsing 的 CPU 适配推理路径,覆盖 Windows 和 Linux 环境。
开发者可以在普通 CPU 环境中完成解析单张图片;批量解析一个目录中的图片或 PDF;启动本地 Gradio Web Demo,直接上传文件体验的任务。
这条路线把 MonkeyOCRv2 的使用门槛进一步降低,个人开发者可以先在笔记本或普通工作站验证效果;企业可以在无 GPU、隔离网络或数据不便出域的环境中完成 PoC;教学、演示和轻负载离线任务,不必先配置一套 CUDA 环境。
需要注意CPU推理与DFlash加速是两条不同路径,DFlash依赖支持它的vLLM/CUDA GPU环境;
CPU 路径使用专门的解析线路,不启用 DFlash。CPU 的优势是硬件可得性和本地部署便利,GPU + DFlash 的优势则是吞吐。
![]()
02
不止文档解析:
一个视觉底座,接入更多下游任务
MonkeyOCRv2 并不是一个只能完成文档解析的封闭模型,还是一个可以被不同 OCR 和 文档智能系统复用的文档原生视觉底座,目前这个文档原生视觉底座已经验证并覆盖七类下游任务:
下游任务
能做什么
文档解析从PDF 或文档图片中恢复正文、标题、表格、公式及版面结构,适用于知识库入库、论文解析和档案数字化等场景。文档理解在看懂文字和版面的基础上回答文档问题,例如从票据、图表或营养成分表中提取指定信息。场景文字识别识别招牌、网页图片、拍摄画面和复杂背景中的中英文文字;视觉编码器可以接入PARSeq、CRNN 等已有识别框架。公式识别将论文、试卷和技术文档中的印刷或手写公式转换成可编辑、可计算的结构化表达。文本检测在复杂图像中定位文字区域,为后续识别、版面分析或内容抽取提供坐标。文档篡改检测识别文档图像中可能被修改、替换或伪造的内容区域,服务于文档真实性与安全分析。重叠文字分割从印章、签名或多层文字互相遮挡的区域中分离不同文字层,帮助恢复重叠内容。
当前项目已经开源了视觉编码器、文档解析、文档理解、场景文字识别和公式识别的相关代码与使用入口,开发者既可以直接采用已经配好的完整模型,也可以只取轻量视觉 Encoder,为自己的识别器、检测器或行业任务提供文档原生视觉特征。
![]()
03
轻量,不是少做事,
而是让更多人做得起来
对于用户和开发者来说,MonkeyOCRv2的轻量化包含三层:
模型轻:视觉编码器 21M/28M 起步,完整解析模型低至 0.6B;
推理轻:GPU 环境可用 DFlash,单页解析在 OmniDocBench 和 MDPBench 上分别实测加速 2.25×、2.27×;
使用轻:CPU 可跑、Windows/Linux 可用,同时提供 CLI、Web Demo 和 API多种接口。
一个足够轻、又足够通用的视觉底座,价值不只是节省算力。它让验证更快、接入更短,也让文档智能离真实业务更近一步。
04
易用,不只是模型小,
还是多接口适配、多任务适配
部署一个模型,最费时间的往往不是下载权重,而是把它接进业务。
MonkeyOCRv2 为文档解析提供了三种入口,分别是CLI用于输入单个文件或整个目录,适合离线批处理;Gradio Web Demo用于本地启动即可上传体验,适合演示和效果验收;FastAPI用于部署后可提供接口给大量用户使用,适合系统集成。
模型权重同时提供 Hugging Face 和 ModelScope 下载入口,对国内开发者也更友好。模型采用 Apache License 2.0 发布,可用于研究与商业场景。
另外,作为多任务通用的文档视觉基座,MonkeyOCRv2已经开源多个任务的权重与训练脚本,用户可以基于这些代码对已适配任务进行重新训练,也可以参考这些代码对其他任务进行适配,这很大程度上减小了模型适配的难度。
从 CPU 上完成第一次解析,到 GPU + DFlash 承接批量服务;
从开箱即用的解析/理解模型,到基于开源代码在不同的适配任务上进行训练,再到把MonkeyOCRv2 接入自己的任务。
MonkeyOCRv2 从多个方面着手给用户和开发者提供一个足够轻量和易用的文档视觉基座。
关注+星标,获取AI前沿进展与开源一线动态
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.