百度的Unlimited-OCR又冲上HuggingFace趋势榜第三
杨立昆都转发了! Unlimited-OCR 为什么这么火?
百度的 Unlimited-OCR 再次冲上 HuggingFace 趋势榜,目前全球第三,又一次排在 GLM-5.2 前面。
上个月它横扫 GitHub、HF 四榜第一,我以为这波热度就过去了,结果图灵奖得主一转发,又把它送回了前三。
GitHub star 破 1.65 万,HF 下载 224 万,还在涨。
传统 OCR 有个老毛病:把文档一页页切开处理,跨两页的表格直接断掉,阅读顺序也丢了。
Unlimited-OCR 用 R-SWA 机制,几十页文档当一个整体连续解析,解码时 KV Cache 恒定——文档再厚,显存占用不涨。
海外博主 Mario Nawfal 实测:100 页 PDF 一次解析完,40 页之后错误率还在 0.11 以下,其他 OCR 到这个长度已经干不动了。
3B 参数,自己电脑就能跑,关键免费。
如果你经常要处理几十上百页的 PDF——论文、合同、扫描件,以前要么手动切页,要么掏钱买 OCR SaaS,现在这两样都省了。
项目地址👇 HuggingFace: #无限OCR #UnlimitedOCR #百度 #文心大模型 #文心