AI Pulse

一张二手RTX 3090就能跑AI助手,还能看150k长文

一个名为 qwen38-27b-rtx3090 的 GitHub 仓库,让单张 RTX 3090 跑 Qwen 3.8 27b 成为可能。发布者说,这个仓库与 DeepSeek harness 配合使用效果极佳,启用视觉功能后,模型可以在单张 3090 上处理 150k 上下文——相当于一次塞进一本厚书的内容。

24GB 显存能容纳 27b 模型,靠的是量化。安装脚本从 Hugging Face 下载一个 4-bit 整数量化的 safetensors 仓库。然后它把其中一部分打包成 8-bit 权重,以加快内存访问。实际仍是 4-bit 量化。8-bit 只是打包方式,不是精度提升。

发布者贴出的运行统计:26 轮对话、489 步。LLM 耗时 161 分 44 秒,工具调用 10 分 47 秒。平均首次响应时间 5.9 秒,生成速度 86 token/秒。缓存命中率 0%,输入 3570 万 tokens,输出 58.6 万 tokens。

这套组合能做的超出单纯聊天。发布者借助本地托管的 Qwen 3.8 27b,为 DeepSeek harness 写了一个 Gmail 插件,成功了。但让模型写搜索引擎插件时,harness 被改坏,整个 DeepSeek harness 无法启动。

有用户将仓库与 Pi 搭配使用,生成速度很快,150k 上下文下模型在交给它的任务上表现依然好,使用 xhigh 推理级别。有用户问 KV cache 的量化级别是 q8 还是 q4——150k 上下文下,缓存几乎占满显存预算,fp16 连权重和视觉塔都放不下。还有用户问怎么让它在 2 张 GPU 上运行,README 里已有说明。

多 GPU 场景存在取舍:用多张显卡可以拿到更高质量的 KV 缓存和模型量化,但这是速度与质量的权衡。只有单张 3090 的话,没有明显缺点。也不是所有反馈都顺利,有用户在高上下文时不断遇到由感叹号组成的报错,计划稍后发布自己的设置。

DeepSeek harness 具体是什么,帖子没有展开,有用户问它是否类似 Claude。帖子没有给出基准测试或对比数据,150k 上下文下的模型质量、报错原因目前还不清楚。

阅读原文
📚 相关主题 大语言模型开源本地部署

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新