手机上运行35B参数AI模型,无需联网GPU
## 手机也能跑
POCKET有多个量化版本,最小8.2GB,最大21GB。压缩后的手机版本专门针对韩语和英语,大小约5GB,能在8GB RAM的安卓或iPhone上跑。模型基于Darwin-36B-Opus(源自Qwen3.5系列的MoE架构),使用Apache-2.0许可证,可以自由修改和分发。
## 质量怎么样
在无GPU的12核AMD mini-PC上,POCKET每秒生成约20个token;在H100上约197 tok/s。CPU上它比领先的1-bit 27B模型快2.7倍,GPU上快2.2倍,质量差不多。在MacBook M3 Pro(18GB内存)——一台真·消费级笔记本——POCKET在所有指标上都优于Bonsai-27B,包括prompt处理。普通电脑不加显卡,也能获得流畅的AI体验。
## 怎么做到的
POCKET用了两种技术把模型压到手机能接受的大小。
一是混合精度量化:attention、共享专家这些每个token都要过的部分,保持高精度;只把路由专家压缩到2-bit以下。这方法在缩小体积的同时保住了质量。
二是领域专家剪枝:先统计韩语和英语实际文本中专家被调用的频率,然后只保留每种语言真正需要的专家。韩语版保留128个专家,仍能覆盖94%的路由。英文手机版用GGUF格式(混合精度量化需要它),韩语iPhone版用MLX格式。
极端量化对韩语质量的影响比英语大2.8倍,而剪枝对英语质量的影响比韩语大3.1倍。用户可以根据语言和硬件挑最合适的版本。
## 使用门槛
POCKET直接用llama.cpp,不需要fork,不需要CUDA,不需要云服务,下载就能跑。无GPU的旧电脑也行。
手机版需要8GB以上RAM。POCKET在iPhone、Mac和Strix Halo上的吞吐量还没测过,作者欢迎社区报告。中文版本是否可用、更老的设备能不能跑,目前都不清楚。
## 不足之处
在GPU prompt处理上,POCKET不如Bonsai-27B(速度只有0.41倍)。如果你需要一次性处理大量文本,Bonsai更快。但日常对话——逐token生成——POCKET反而更快。
POCKET不是万能模型,但在个人设备上跑大模型这件事上,它把门槛降到了用户能立刻试一把的程度。