手机AI新模型本地看懂图片文档,速度提升19倍
Tether AI Research 发布了 VisionPsy-Nano,一个约4.6亿参数的视觉语言模型家族,专门为手机和边缘设备设计。它有两个版本:注重质量的 VisionPsy-Nano-460M,和注重速度的 VisionPsy-Nano-460M-Flash。
速度:手机上的延迟几乎不可感知
Flash 版本的最大卖点是快。在 Pixel 9、Galaxy S23 和 S25 Ultra 上,它输出第一个字符的速度比同类模型 nanoVLM-460M-8k 和 SmolVLM2-500M 快了约19到23倍。在 iPhone 15 上,这个数字达到了36倍。完成一次描述任务,在 Pixel 9 上只需10.6秒,比 LFM2.5-VL-450M 快2.5倍。
速度提升的关键是 Flash 版大幅压缩了视觉信息——一张512x512的图片只生成64个视觉标记,而其他模型用了1088个。质量几乎没有牺牲:标准化得分从62.3降到61.4,保留了约99%的能力。
性能:小体积也能胜过更大模型
在17个常见基准测试中,质量版在16个上优于同尺寸(约5亿参数)的竞品,包括 LFM2.5-VL-450M、SmolVLM2-500M 和它自己的前身 nanoVLM-460M-8k。能力被分为四类:文档理解与OCR、视觉感知、推理与知识、指令遵循与可靠性。质量版在全部四个类别中排第一。在指令遵循与可靠性类别中,它甚至胜过比它大1.6到2.3倍的模型,比如 FastVLM-0.5B、Qwen3.5-0.8B 和 InternVL3.5-1B。
开源:开发者可以免费集成
模型以 Apache 2.0 许可证开源,权重开放,可在 Hugging Face 和 GitHub 上获取。它支持三种推理路径:全精度的 Transformers(参考用)、GGUF 量化版本(手机上跑)、vLLM(服务器高吞吐推理)。开发者可以把它集成到拍照翻译、文档扫描、智能助手等应用里,部署成本很低。
安全与限制
模型经过安全红队测试,在288个对抗案例中的通过率为76.9%,高于 nanoVLM-460M-8k 的65.9%和 SmolVLM2-500M 的61.9%。不过它目前只擅长处理单张图片——适合拍照问路牌、看说明书、分析单张图表,但无法处理多图或视频。语言方面,主要支持英语,其他语言尚未正式支持。Tether AI 表示欢迎社区进行微调。接下来计划发布完整技术报告和一个浏览器里的 WebGPU 演示。
这是 Tether AI 在端侧视觉语言模型领域的首次出手,后续是否会发布更大参数版本或支持多语言,尚未明确。