如果你玩过本地大模型,大概率都遇到过这个难题:打开 Hugging Face,一搜就是几百个模型。Qwen、Llama、DeepSeek、Mistral……从 7B、14B 到 27B、32B,再加上各种 Q4、Q5、Q6、GGUF、EXL2……看着眼花缭乱。
最后,你大概率会去论坛或搜索引擎发问:
24GB 显存,最适合跑哪个模型?
遗憾的是,这个问题过去一直没有标准答案。最近正好发现了一个专门解决这个难题的开源工具 —— whichllm,一个专为本地 AI 打造的模型选型工具,目前在 GitHub 上已经收获近 6000+ Star。 它会自动扫描你的电脑配置,结合公开的评估榜单与性能数据,直接告诉你:
- 哪些模型你的电脑能跑;
- 哪个模型最值得跑;
- 哪些虽然能跑,但实际体验并不推荐。
它不只是查配置,而是在帮你做选型决策
whichllm 运行的第一步,是扫描你的硬件环境(包括 GPU 显存、系统内存、CPU 等)。
紧接着,它会对比 Hugging Face 上的热门开源模型,并参考 LiveBench、Artificial Analysis 等主流 Benchmark 的最新成绩,自动生成一份定制化推荐列表。
它绝不是简单地按参数大小排序,而是综合评估四个维度:
- 模型综合质量;
- 实际推理速度;
- 硬件适配度;
- 最匹配的量化方案。
例如,面对同一块 24GB 显存的显卡,它给出的推荐列表可能是这样的:
#1 Qwen3.6-27B Q5_K_M Score 92.8
#2 Qwen3-32B Q4_K_M Score 83.0
#3 Qwen3-30B-A3B Q5_K_M Score 82.7
初看可能会觉得奇怪:为什么 27B 会排在 32B 前面?原因很简单——它不只看参数数量,还会考虑真实 Benchmark、模型代际以及运行效率。 参数更大,并不一定代表实际体验更好。
能跑,不代表值得跑
很多初学者刚接触本地模型时,容易掉入一个误区:显存能装下的最大模型,就是最好的选择。
事实并非如此。
比如一块 24GB 显存的显卡,既能勉强塞下一个上一代的 32B 模型,也能轻松运行一个最新的 27B 模型。但在实际测试中,全新的 27B 模型不仅综合表现更好,生成速度也更快。模型参数量的大小,早已不能完全代表最终的使用体验。
连量化方案,都帮你选好了
以往很多工具只能做到“告诉你这个模型能跑”,至于具体下载 Q4、Q5 还是 Q6 压制的版本,依然需要用户自己去折腾测试。
而 whichllm 最贴心的地方在于,它会直接给出具体的量化方案建议:
- 如果你的显存较为充裕,它会优先推荐精度保留更好的高位宽量化方案(如 Q5/Q6);
- 如果显存比较吃紧,它则会建议选择位宽更低的版本(如 Q4),并提示可能存在的精度损耗。
对刚上手本地模型的新手来说,这一步能节省大量试错和重复下载的时间。
上手体验
whichllm 的使用门槛极低,从安装到得出推荐,全程都不需要查阅繁琐的技术文档。 安装很简单,使用 x-cmd 一行命令搞定:
x install whichllm
安装完成后,直接运行:
whichllm
几秒钟内,它就能完成硬件扫描并输出结果。推荐列表中会清晰标注:
- 模型与当前硬件的适配度;
- 推荐使用的量化方案;
- 预估的推理速度;
- 综合推荐排名。
它和 Ollama,其实是黄金搭档
不少人容易把 whichllm 和 Ollama 混为一谈。实际上,它们定位完全不同:
- Ollama 解决的是: 模型怎么快速下载和运行起来(执行者);
- whichllm 解决的是: 面对海量模型,到底该选哪一个(决策者)。
这两个工具组合起来非常顺畅——先用 whichllm 完成科学选型,再交由 Ollama 一键拉取运行,构建出一套完整的本地 AI 工作流。
本地大模型,正式进入“高效选型”时代
whichllm 能在短时间内收获高 Star,反映了当前本地 AI 生态的一个新变化:本地大模型正从“缺少模型可用”,走向“模型多到不知如何选择”。
每天都有新的架构发布、新的量化方案推出、新的榜单更新。对大多数使用者而言,最昂贵的成本不再是显卡或下载流量,而是不断下载、测试、对比的试错成本。
whichllm 做的,就是把原本需要花费数小时查 Benchmark、翻论坛、算显存的繁琐流程彻底自动化。它能用最直观的数据告诉你:在当前硬件条件下,选哪个模型才能榨干设备的最高性价比。