两个免费开源AI工具:本地模型选择与自托管协作
本文不吹不黑,依据GitHub项目快照(2026-05/06)拆解whichllm和Paca的真实门槛,帮你对照需求决定要不要用。
先别问“怎么挑”,先问“我需要吗”
两个工具解决的不是同一类问题。whichllm 是一个命令行工具,帮你找出当前硬件能跑哪些本地大模型、哪个表现最好;Paca 是一个自托管项目协作平台,目标是替代 Jira 这类工具,并让 AI 代理像人类一样参与任务。把它们放在一起说,只是因为它们都在 GitHub 上免费开源、这一阵子热度不低。而“挑”这个动作是错的——正确的问题是:你遇到了哪种需求?本文信息截至 2026 年 8 月,依据的是两个项目在 GitHub 上的文档和快照(whichllm 快照 2026-05,Paca 快照 2026-06),不包含我们自己的部署实测。
whichllm:本地模型不是“装得下”就行
什么情况需要本地模型?常见三个理由:数据不想传到云端、在离线环境工作、想省掉按次计费的 API 支出。但本地跑模型有个很多人踩过的坑——能装进显存不等于好用。显存(显卡的专用内存,决定你能加载多大的模型)只解决了“放不放得下”,而模型的实际质量要看真实基准分数。whichllm 的做法是:自动检测你的硬件(支持 NVIDIA、AMD、Apple 芯片和纯 CPU),然后从 HuggingFace 拉取模型列表,结合 LiveBench、Artificial Analysis、Aider 等多个基准的合并分数,再按你的显存、速度和量化方式(一种压缩模型体积的技术,会影响质量和速度)排出推荐名次。
举项目快照(2026-05)里的例子:在 RTX 4090(24GB 显存)上,它推荐 Qwen3.6-27B,速度约 27 token/s;在 RTX 4060(8GB)上推荐 Qwen3-14B;Apple M3 Max(36GB)同样能跑 Qwen3.6-27B,但速度降到约 9 token/s;纯 CPU 机器也有推荐,比如 gpt-oss-20b(混合专家模型,速度约 6 token/s)。这些数字是动态的,会随 HuggingFace 上的模型更新而变化。
使用方式是一条命令,比如 whichllm --gpu "你的显卡型号",它会输出排名列表;也能输出 JSON 格式,方便接进脚本。对不爱命令行的用户,这是主要门槛——你至少要知道自己的显卡型号、显存大小,并愿意在终端里敲命令。如果只是在手机上用 AI,或者用云端 API 就满足,那这个工具帮不上忙。
Paca:让 AI 代理成为团队成员的代价
另一类需求是团队协作。如果你的团队用 Jira、Trello 这类商业工具,会碰到两个烦恼:按座位收费,以及数据放在别人服务器上。Paca 的定位是“AI 时代的开源项目管理平台”,核心设计让 AI 代理和人类在同一个 Scrum 看板上工作——代理可以被分到迭代里、从待办里领任务、实时更新状态、帮忙写 BDD 测试场景(一种用自然语言描述行为来驱动开发的方式)。它支持用配置文件调整工作流、字段、看板布局和代理行为,项目说明里写“无需编码即可适配流程”;但插件系统需要把 Go、Rust、AssemblyScript 等语言编译成 WebAssembly 模块,这明显不是普通用户能玩的。
所以使用门槛要诚实说:免费和开源是真的,但“自托管”意味着你得出服务器、做部署、盯着维护和升级。即使只用默认配置,也得有人能看日志、解决问题。项目方在 README 对比表里写 Jira 等商业产品大约 8 到 20 多美元一个座位每月,而 Paca 免费——但请把自托管的人力成本算进去。如果团队里没有懂点技术的成员,这笔“免费”可能比订阅费更贵。
怎么判断该不该用
问自己四个问题。第一,你有本地硬件,且数据隐私或离线是硬需求吗?没有的话,云端 API 更省心。第二,你能接受命令行和基本的硬件参数吗?不能的话,whichllm 不适合。第三,你的团队是否有能力承担服务器运维?没有的话,Paca 的免费会变成负担。第四,你需要的只是“看板和任务管理”,还是真的想让 AI 代理深度参与迭代?后者才是 Paca 的初衷。两个项目都在快速迭代,文档和快照日期不同(whichllm 截至 2026-05,Paca 截至 2026-06),决定前最好去 GitHub 看看最新 README,确认项目是否仍然活跃。本文没有亲手部署,以上分析基于项目公开信息,不构成“好用”的保证。