千帆-OCR:文档智能的统一端到端模型

发表
daxiangdaxiang 提交
作者: daxiangDaxiang Dong, Mingming ZhengMingming Zheng, Dong Xu, chunhua luoChunhua Luo, Bairong Zhuang, Yuxuan Li, Ruoyun He, Haoran Wang, Wenyu Zhang, Wenbo Wang, yichengYicheng Wang, Xue Xiong, ZhengAyong Zheng, Shawing ZuoXiaoying Zuo, Ziwei Ou, Jingnan Gu, Quanhao Guo, Jianmin Wu, Dawei Yin, Dou Shen

摘要

AI 生成总结
千帆-OCR 是一个 4B 参数的视觉语言模型,它将文档解析、布局分析和理解统一起来,通过其“布局即思考”(Layout-as-Thought)机制在多个 OCR 基准测试中保持强劲性能。
我们推出了 Qianfan-OCR,这是一个 4B 参数的端到端视觉语言模型,在单一架构中统一了文档解析、版面分析和文档理解。它实现了直接的“图像转 Markdown”转换,并支持包括表格提取、图表理解、文档问答和关键信息提取在内的多种提示词驱动任务。为了解决端到端 OCR 中显式版面分析缺失的问题,我们提出了“版面即思考”(Layout-as-Thought),这是一种由特殊思考 token 触发的可选思考阶段,在产生最终输出前生成结构化版面表示——包括检测框、元素类型和阅读顺序,在提升复杂版面准确率的同时恢复了版面接地(grounding)能力。Qianfan-OCR 在端到端模型中位列 OmniDocBench v1.5 (93.12) 和 OlmOCR Bench (79.8) 第一,在 OCRBench、CCOCR、DocVQA 和 ChartQA 上与同规模通用 VLM 相比具有竞争力,并在公开的关键信息提取基准上获得最高平均分,超越了 Gemini-3.1-Pro、Seed-2.0 和 Qwen3-VL-235B。该模型可通过百度智能云千帆平台公开访问。
查看 arXiv 页面查看 PDF

评论

daxiangdaxiang
论文作者
论文提交者

端到端 OCR 模型是未来的研究方向吗?

Vivis DevVivis Dev

使用这个模型与 PaddleOCR-VL-1.5 相比有什么优势?后者是一个 0.9B 的模型,在 OmniDocBench v1.5 上得分 94.5,并且由于模型体积较小,处理速度可能更快。