同一个模型ID,不同提供商给的可能是不同量化版本
VLM Run Gateway 是一个统一API,用来跑开源的视觉模型。无论 VLM、OCR VLM 还是基于 ViT 的视觉模型,都从同一个入口进。
团队做它的动机来自生产环境的实际挫折。跑VLM时,视觉准确率会栽在很多细节上。同一个模型ID,不同提供商给的可能是不同量化版本、不同环境。连 vLLM/SGLang 服务参数都可能不一样。文本测试看着没问题;一测OCR、小字、空间位置就露馅。
视频更麻烦。团队测试视频原生VLM时,超过80%的提供商不支持视频输入。能控制帧率的更少。文档推理同样耗人。栅格化PDF、并行处理页面、重试失败页、应对速率限制,每一步都吃掉开发时间。
网关把这些服务、运行时和流水线都揽到底下。换模型名就能对比不同模型,例如 GLM-OCR、PaddleOCR VL 1.6。
但标准化挡不住所有差异。上下文限制、最大分辨率、帧率采样、量化、GPU SM 架构,都可能影响视觉质量。模型ID一样,差异照样在。
目前网关免费,不用注册,还在alpha阶段。命令行工具可以用 pip 安装,也能用 uvx 直接跑。聊天、PDF、图片、视频都能作为输入。它最初是团队内部给智能体和评估用的,现在开放出来了。