近日,百度正式对外发布新一代文档识别模型 PaddleOCR-VL-1.6。据官方公布的评测数据,该模型在多项权威基准测试中刷新业界最优(SOTA)记录,综合性能跻身全球第一,引发业内广泛关注。
![]()
1、评测成绩亮眼,多项指标超越国际主流模型
在当前 OCR 领域公认的权威评测集 OmniDocBench v1.6 上,PaddleOCR-VL-1.6 取得 96.33% 的总分,超过谷歌 Gemini-3-Pro、OpenAI GPT-5.2、MinerU-2.5-Pro 及国内的 GLM-OCR 等主流大模型与专用 OCR 方案,综合排名全球第一。
在面向真实复杂场景设计的 Real5-OmniDocBench 评测中,该模型同样表现突出,总指标达到 93.19%,较 Gemini-3-Pro 提升约 4 个百分点,在扫描件、弯折文档、屏幕拍照、光照变化及倾斜文档五类真实场景下均保持领先。
据了解,PaddleOCR 系列在文本、公式、表格等核心识别能力上实现全面升级,表格结构还原、古籍文字辨认与生僻字识别等复杂任务的准确率较上一代模型均有显著提升;印章识别、图表解析及文字定位(Spotting)等多项能力亦同步强化。
![]()
2、轻量架构不变,开发者可无缝迁移
值得关注的是,PaddleOCR-VL-1.6 在保留上一代 0.9B 轻量化参数规模的前提下实现了性能跃升,通过模型驱动的数据构建机制与渐进式训练优化完成能力迭代。由于新旧两代模型结构保持一致,已在生产环境中部署 PaddleOCR-VL-1.5 的开发者和企业用户,无需额外适配即可平滑迁移至新版本,降低了升级成本。
PaddleOCR 系列模型基于百度文心大模型训练而来,是文心多模态能力的重要组成部分,目前支持超过 100 种语言识别,用户群体覆盖全球 170 余个国家和地区。自项目开源以来,PaddleOCR 在 GitHub 上的 Star 数已突破 79,200,超越谷歌旗下老牌开源项目 Tesseract OCR,成为全球最受开发者关注的开源 OCR 项目之一。
3、即刻可用,代码与权重全面开放
PaddleOCR-VL-1.6 目前已正式上线 PaddleOCR 官方网站(paddleocr.com),支持网页端在线体验及 API 调用;模型代码与权重文件已同步开源至 GitHub(github.com/PaddlePaddle/PaddleOCR)及 Hugging Face(huggingface.co/PaddlePaddle/PaddleOCR-VL-1.6),面向全球开发者免费开放。
随着文档数字化需求的持续增长,高精度、强鲁棒性的 OCR 能力正成为企业智能化转型的关键底座。此次 PaddleOCR-VL-1.6 的发布,或将进一步推动国产开源 OCR 技术在全球范围内的采用与落地。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.