我的电脑能跑哪个 AI 模型?whichllm 帮你找到答案

0 阅读4分钟

如果你玩过本地大模型,大概率都遇到过这个难题:打开 Hugging Face,一搜就是几百个模型。Qwen、Llama、DeepSeek、Mistral……从 7B、14B 到 27B、32B,再加上各种 Q4、Q5、Q6、GGUF、EXL2……看着眼花缭乱。

最后,你大概率会去论坛或搜索引擎发问:

24GB 显存,最适合跑哪个模型?

遗憾的是,这个问题过去一直没有标准答案。最近正好发现了一个专门解决这个难题的开源工具 —— whichllm,一个专为本地 AI 打造的模型选型工具,目前在 GitHub 上已经收获近 6000+ Star。 它会自动扫描你的电脑配置,结合公开的评估榜单与性能数据,直接告诉你:

  • 哪些模型你的电脑能跑;
  • 哪个模型最值得跑;
  • 哪些虽然能跑,但实际体验并不推荐。

whichllm.png


它不只是查配置,而是在帮你做选型决策

whichllm 运行的第一步,是扫描你的硬件环境(包括 GPU 显存、系统内存、CPU 等)。

紧接着,它会对比 Hugging Face 上的热门开源模型,并参考 LiveBench、Artificial Analysis 等主流 Benchmark 的最新成绩,自动生成一份定制化推荐列表。

它绝不是简单地按参数大小排序,而是综合评估四个维度:

  • 模型综合质量;
  • 实际推理速度;
  • 硬件适配度;
  • 最匹配的量化方案。

例如,面对同一块 24GB 显存的显卡,它给出的推荐列表可能是这样的:

#1  Qwen3.6-27B      Q5_K_M    Score 92.8
#2  Qwen3-32B        Q4_K_M    Score 83.0
#3  Qwen3-30B-A3B    Q5_K_M    Score 82.7

初看可能会觉得奇怪:为什么 27B 会排在 32B 前面?原因很简单——它不只看参数数量,还会考虑真实 Benchmark、模型代际以及运行效率。 参数更大,并不一定代表实际体验更好。


能跑,不代表值得跑

很多初学者刚接触本地模型时,容易掉入一个误区:显存能装下的最大模型,就是最好的选择。

事实并非如此。

比如一块 24GB 显存的显卡,既能勉强塞下一个上一代的 32B 模型,也能轻松运行一个最新的 27B 模型。但在实际测试中,全新的 27B 模型不仅综合表现更好,生成速度也更快。模型参数量的大小,早已不能完全代表最终的使用体验。


连量化方案,都帮你选好了

以往很多工具只能做到“告诉你这个模型能跑”,至于具体下载 Q4、Q5 还是 Q6 压制的版本,依然需要用户自己去折腾测试。

而 whichllm 最贴心的地方在于,它会直接给出具体的量化方案建议

  • 如果你的显存较为充裕,它会优先推荐精度保留更好的高位宽量化方案(如 Q5/Q6);
  • 如果显存比较吃紧,它则会建议选择位宽更低的版本(如 Q4),并提示可能存在的精度损耗。

对刚上手本地模型的新手来说,这一步能节省大量试错和重复下载的时间。


上手体验

whichllm 的使用门槛极低,从安装到得出推荐,全程都不需要查阅繁琐的技术文档。 安装很简单,使用 x-cmd 一行命令搞定:

x install whichllm

安装完成后,直接运行:

whichllm

几秒钟内,它就能完成硬件扫描并输出结果。推荐列表中会清晰标注:

  • 模型与当前硬件的适配度;
  • 推荐使用的量化方案;
  • 预估的推理速度;
  • 综合推荐排名。

它和 Ollama,其实是黄金搭档

不少人容易把 whichllm 和 Ollama 混为一谈。实际上,它们定位完全不同:

  • Ollama 解决的是: 模型怎么快速下载和运行起来(执行者);
  • whichllm 解决的是: 面对海量模型,到底该选哪一个(决策者)。

这两个工具组合起来非常顺畅——先用 whichllm 完成科学选型,再交由 Ollama 一键拉取运行,构建出一套完整的本地 AI 工作流。


本地大模型,正式进入“高效选型”时代

whichllm 能在短时间内收获高 Star,反映了当前本地 AI 生态的一个新变化:本地大模型正从“缺少模型可用”,走向“模型多到不知如何选择”。

每天都有新的架构发布、新的量化方案推出、新的榜单更新。对大多数使用者而言,最昂贵的成本不再是显卡或下载流量,而是不断下载、测试、对比的试错成本。

whichllm 做的,就是把原本需要花费数小时查 Benchmark、翻论坛、算显存的繁琐流程彻底自动化。它能用最直观的数据告诉你:在当前硬件条件下,选哪个模型才能榨干设备的最高性价比。