0.8B OCR模型分数逼近35.1B大模型,参数仅其四十四分之一
LightOnOCR-3 是 LightOn 发布的新一代 OCR 模型家族,有 0.8B、1B、4B 三个尺寸。0.8B 和 4B 版本用 Qwen3.5 视觉语言架构,1B 版本保留上一代架构。
一个模型,两种模式
模型的工作方式看提示词。提示词留空,做纯转录,把页面文字变成文本。加上 grounding,每个内容块前会附上带标签的边界框标记,同时还输出图像描述和以表格形式提取的图表数据。坐标归一化到 0 到 1000,位置信息精确到块级。
拿到手的是一份带“地图”的文档:段落、标题、图片的位置一目了然。后续的可编辑、可搜索流程直接能用,不用手动重建版面。
图表数据,防的是“编”
图表数据提取时,先用 Qwen3-VL-235B 对每个图表区域生成一个 JSON 对象,记录类型、内容和置信度。随后图表被转换成一个 HTML 表格,要求每个柱、每个点、每个切片都覆盖。打印出来的数值原样抄录;没打印的,按轴刻度估算;读不出的格子,留空。
为了防止模型自己“脑补”数据,标注管道设了一道闸。两列数值完全相同、一列重复同一数值三次以上、某个值填满 60% 以上,撞上任何一种,整份图表表格都不输出。与其给一个看似完整实则虚构的结果,不如明确说数据不可靠。这套机制挡的是文档数据里最不该出现的错误。
小模型,不慢
性能上,LightOnOCR-3 在多个基准里拿出了接近甚至超过超大模型的分数。olmOCR-Bench 上,4B 版本总分 86.3,比 35.1B 参数的 Infinity Parser Pro 低 1.3 分;和同尺寸的 Chandra 2 比,高出 0.5 分。ParseBench 上,4B 和 0.8B 变体排前两名,得分 75.1 和 74.6。Infinity Parser Pro 的 74.3 落在后面。法语文档基准 fr-bench-pdf2md 上,4B 版本 74.1 分;0.8B 版本 70.5 分,差 3.6 分。
速度也没因为输出内容变多而慢下来。同样分辨率下,4B 版本每秒处理的页面比 Chandra-OCR-2 多 14%;单页延迟最低的是 1B 版本,只要 2.7 秒。token 效率也压下来了。grounding 模式下,0.8B 和 4B 生成的输出 token 平均比竞品少 9–14%。输出里还带着边界框、图像描述和图表数据。更少的 token 装更多内容。
开源与训练细节
模型以 Apache 2.0 许可证发布,研究和商用都行。权重可自由下载,企业不用付授权费,也能基于自身需求微调。
训练数据的配比体现了难点:公式页权重加倍,表格页权重三倍。另外加入了手写样本和 DocDuck 库生成的合成页面。全部采样里 78.1% 分给纯 OCR 任务,21.9% 分给 grounding 任务。
训练中的 grounding 数据由一套多模型管道自动标注。LightOnOCR-2-1B 负责参考转录。PaddleOCR 的 PP-OCRv6 做文本行检测和识别。PP-DocLayoutV3 与 Docling 提供版面信息;docTR 的 DB-ResNet50 做词级检测。
管道过滤很严格:只有 55% 的样本通过初始检查,后续递归恢复阶段再额外回收约 10%。目的只有一个,在训练前把低质量数据挡在门外。
强化学习阶段也卡得细。983 页高密度页面,平均每页 31.5 个边界框;1654 页中密度页面,平均每页 13 个边界框。这两组作为锚点,加上合成文档和空页。训练用 GRPO,组大小 8,生成与策略优化在不同 GPU 池上异步运行。每次运行用 600 个独特页面,不同随机种子之间只有 14–15% 的页面重叠。最后做参数平均,避免过拟合。
开放的另一面
LightOnOCR-3 没有针对基准测试定制训练数据或输出格式,但评分前会对原始输入应用归一化函数。训练和推理用到 MeluXina 和 Jean Zay 两处超算资源。
中文、阿拉伯语等非英语文档上的表现,目前没有数据。低质量扫描和手写混在一起的场景,也没谈鲁棒性。商业服务在复杂版面上的性价比,同样没有对比。
模型以 Apache 2.0 发布,等于把使用决定权放在下载者手里。权重没有任何门槛,开发者的控制力只到发布为止。