5060 Ti 跑大模型的配置,有人测好了,直接抄
手里有一块或两块 RTX 5060 Ti 16GB,直接复制别人测过的配置就能跑大模型。参数不用自己调。项目重构后分成三块:预设、证据包、原始记录。预设是抄来就能跑的完整配置。证据包是过了检查的记录,覆盖上下文适配、检索、持续生成和性能。原始记录放重试、失败实验和诊断日志,只当工程材料,不自动变成建议。网站首页主打预设目录,结果浏览器退到二线。
七份预设,两条路线。单卡三份:Qwen3.8 27B IQ3_XXS,64K 上下文,q8 KV,内置 MTP;ThinkingCap Qwen3.6 27B IQ3_M,64K;Nail 35B-A3B IQ3_XXS,131K 路由。双卡四份:Qwen3.8 27B Q6_K、ThinkingCap Qwen3.6 27B Q6_K、Nail 35B-A3B Q4_K_XL,全部 131K;Muse Glimmer 30B 动态 Q4,也是 131K,启用 DFlash。
这些预设不是能跑一下就算数。测试框架把提示词校准到模型实际分词器,禁用提示缓存,每个请求配唯一 nonce。长上下文检索和持续生成测试反复跑。失败的层级和不完整的运行会被记录。脚本能生成候选报告,但不能自动打 recommended 标签发布。这套框架已经抓到好几例翻车。有的模型能加载大上下文,但检索失败;有的在隐藏推理里停住,给不出稳定的可见输出。
单卡推荐 Qwen3.8 27B IQ3_XXS,64K 上下文,q8 KV,内置 MTP n=2。45.9K token 提示词下,持续解码约 29.8 tok/s。两次未缓存检索、两次持续可见答案检查都通过。双卡推荐 Qwen3.8 27B Q6_K,131K 上下文,f16 KV,50/50 张量拆分,内置 MTP n=2。两次检索检查在约 115.4K 提示词下通过。两次持续检查在约 91.8K 提示词下通过,每次生成 3,072 token 并到达可见答案。prefill 约 597.9 tok/s,持续解码约 38.6 tok/s。
几个边界写得很明确。131K 是这套预设测到的最高档位,不等于模型绝对最大上下文。测试框架原本给思考模型 1,536 token 输出配额。Qwen3.8 可能把大部分预算花在内部推理,还没到可见答案就用完。现在配额和最低生成量要求分开算,思考重的模型能收尾,通过线没放宽。测量时核心时钟锁定 2300 MHz,功耗限制 180W。这是作者平时更安静的运行点,自动加速或超频的卡可能更快。
1× 和 2× 只是作者本地能测的范围,不是项目上限。数据模型和贡献路径支持 3×/4× 配置、混合 GPU 和其他 CUDA 硬件,前提是拓扑和部署配置报清楚。这几条路线目前还没有验证过的数据。项目欢迎复现、失败的适配检查、混合 GPU 设置和更大的 5060 Ti 配置。贡献者要报告模型、量化、上下文、KV 缓存、运行时、拓扑、提示长度、生成 token 和服务标志。仓库在 github.com/5p00kyy/club-5060ti,预设目录和证据浏览器在 5p00kyy.github.io/club-5060ti。
评论区已经在补数据。Danmoreng 给 16GB 卡写了特殊配置,5080 笔记本 175W 下拿到 60-80 tok/s。o0genesis0o 的 4060 Ti 开 MTP 从没让任何 27B 模型超过 10 tok/s。他怀疑 5060 Ti 快这么多。Pixer--- 说 llamacpp 的 prefill 还是短板。他的双 5060 Ti 不带 MTP 能到 3k prefill 和 40 tok/s。180K 上下文只有 nvfp4 装得下。