GLM-OCR仅0.9B参数,开源拿下文档理解基准第一
GLM-OCR 是个多模态 OCR 模型,专门处理复杂文档。架构上,视觉端用 CogViT 编码器,解码端是 GLM-0.5B,中间用跨模态连接器做 token 下采样。
流程分两步。第一步,PP-DocLayout-V3 做版面分析。第二步,并行识别文字、公式和表格,输出结构化内容。
在 OmniDocBench V1.5 基准上,它得分 94.62,排名第一。公式识别、表格识别、信息提取等分项也达到最先进水平。这个模型本来就按实际业务场景调过。复杂表格、代码密集的文档、带印章的扫描件,它都稳得住。这些都是传统 OCR 容易翻车的版式。训练时用多 Token 预测损失,加上稳定的全任务强化学习。目标很明确:提升训练效率、识别准确率和泛化能力。
模型只有 0.9B 参数。在单副本、单并发、同一硬件条件下,PDF 吞吐 1.86 页/秒,图片 0.67 张/秒。这个数字比同类模型快不少。支持 vLLM、SGLang 和 Ollama 部署。推理延迟和成本都低,高并发服务和边缘设备都能跑。个人或小团队搭识别管线,不用太担心算力门槛。
模型和配套 SDK 一起开源。SDK 集成了 PP-DocLayout-V3,安装简单。一行代码就能处理 PDF 或图片,产出结构化结果。模型支持两种提示场景。文档解析覆盖文本、公式、表格。信息提取按严格 JSON 模式输出,方便下游程序接。但 SDK 目前只管文档解析,信息提取要直接用模型跑。
许可证要分开看。模型本体是 MIT,可以自由改、商用。完整流程里集成的 PP-DocLayout-V3 走 Apache License 2.0,两份都得遵守。MIT 不覆盖整个项目。技术报告在 arXiv 上,编号 2603.10910。项目文档里还列了 PP-DocLayout-V3、PaddleOCR、MinerU 作为启发来源。落地时把文档解析和信息提取这两段接起来,目前得自己处理。