模型开源了,能跑的人却越来越少

0 阅读7分钟

现在的开源大模型有个挺分裂的现象:权重给得越来越大方,能自己跑起来的人却越来越少。

拿 DeepSeek-V4-Pro 举例。它的规格是 1.6 万亿总参数、每个 token 激活 490 亿、原生支持 100 万 token 上下文,MIT 许可,权重完全开放。这是相当彻底的开源,没有申请、没有商用限制、没有区域限制。

然后你去算一笔账就会发现,这个「开放」对绝大多数人是没法兑现的。

先把显存的账算出来

模型权重占多少显存,算法很简单:

参数量 × 每个参数占几个字节。

BF16 或者 FP16 精度下,每个参数 2 字节。所以:

1.6T × 2 = 3.2TB。

光是把权重装进去,就需要 3.2 TB 显存。

对照一下现在的单机配置:

一台 8 卡 H100,80GB 一张,共 640GB。 一台 8 卡 H200,141GB 一张,共 1128GB。 一台 8 卡 B200,192GB 一张,共 1536GB

3.2TB 除以 141GB,大约需要 23 张 H200。任何一台 8 卡单机都装不下,必须多节点。

就算做激进的量化,INT4 精度下每参数 0.5 字节,1.6T × 0.5 = 800GB,8 卡 H100 的 640GB 仍然不够,得上 H200。

而且这笔账只算了权重。KV cache 没算,激活值没算,推理框架的开销没算。那个 100 万 token 的上下文,KV cache 要单独占掉很大一块。所以实际需求比 3.2TB 还高。

同系列的 V4-Flash 好一些:284B 总参数,BF16 约 568GB,8 卡 H100 的 640GB 刚好放得下。这也是为什么大部分人实际能碰到的是 Flash 这一档。

一个被普遍搞混的地方

这里有个技术细节,我发现挺多人理解反了。

DeepSeek-V4-Pro 是稀疏 MoE 架构,1.6 万亿参数里,每个 token 只激活 490 亿,激活比 3.06%(49 除以 1600)。

官方技术报告给的效率数据也很漂亮:相较上一代 V3.2,在 100 万上下文下,单 token 推理的 FLOPs 只需要 27%,KV cache 只需要 10%。

看到这组数字,很容易得出一个结论:既然只用 3% 的参数,那部署起来应该也只要 3% 的资源吧。

不是这样。

MoE 的路由是按 token 动态选择的。这个 token 路由到第 7、23、104 号专家,下一个 token 可能路由到完全不同的几个。你没法预知,也没法只加载一部分。

所以标准部署要求全部专家权重驻留显存,不是只放被激活的那 3%。

技术上确实可以做专家卸载,把不常用的专家放到 CPU 内存甚至磁盘,用的时候再换进来。但显存和内存之间的带宽差着一个数量级,每次换入都要等,延迟会涨得很难看。对于追求吞吐的线上服务,这条路基本不可行。

所以「激活参数少」省的是算力,不省显存。

官方那组 27% FLOPs、10% KV cache 的收益,全在计算和缓存这两个维度上。存储维度上,你该装 1.6T 还是得装 1.6T。

这就解释了一个表面上矛盾的现象:

模型的推理越来越便宜,能自己部署的人却越来越少。

这两件事同时成立,而且都是 MoE 带来的。稀疏化让每 token 的计算成本大幅下降,所以 API 价格能一路降;但总参数量在同步膨胀,显存门槛跟着总量走,所以自部署的硬件要求一路涨。

开源的受益者结构变了

权重开放本身是实打实的,MIT 许可、完全开放、任何人可以下载。据公开报道,V4-Pro 首周下载量超过 17 万次。

但下载得动,不代表跑得动。

我把能真正用上这份权重的人分了三类:

**第一类,有多节点集群的。**云厂商、大厂的基础设施团队、少数几家有算力储备的公司。他们能完整部署,能做深度定制,能基于完整权重做继续训练。这份开源对他们是真正意义上的开源。

**第二类,能跑量化版和小版本的。**INT4 量化上 8 卡 H200,或者干脆用 284B 的 Flash 档。这类团队拿到的是打过折的能力,但至少东西在自己手里。

**第三类,只能调 API 的。**绝大多数人在这一档。对这些人来说,这个模型开不开源,体感上没有区别,反正都是调接口、按 token 付费。

开源在这里的实际作用发生了转移:它不再主要是「让每个人都能自己跑」,更多是「让第一类玩家不被单一供应商锁住」。

这个作用依然重要,甚至可能更重要。多一份可以自己部署的高水平权重,云厂商之间的议价空间就多一分,模型层被垄断的风险就小一分。但它跟很多人心目中开源的样子已经不一样了。

十年前你 clone 一个开源项目,编译一下就能在自己笔记本上跑。现在你 clone 一份开源权重,需要一个机房。

那中小团队该怎么办

抱怨没有意义,说点实际的。

**优先看小版本和蒸馏版。**同系列的 Flash 档、蒸馏出来的小模型,往往能覆盖八成的实际需求。1.6T 那个旗舰,多数业务场景根本用不上它的上限。

**别把「开源」当成「能自己部署」的同义词。**选型时先算显存账,参数量乘以精度字节数,再对一下手上的卡。这个算术两分钟能做完,能省掉很多后面的麻烦。

**量化不是免费的。**INT4 能把 3.2TB 压到 800GB,但精度损失在不同任务上差异很大,长文本和复杂推理场景掉得更明显。要用就得实测,不能只看别人的 benchmark。

**如果最终还是走 API,那就把重点放在别的地方。**比如同一个模型在不同供应商那里的价格和稳定性差异,比如能不能随时切换到别家。开源权重的存在,本身就是你跟供应商谈判的筹码,哪怕你一次都没自己部署过。

往后看

**参数量还会涨,激活比还会往下压。**这个方向对做 API 的人是好事,单位 token 成本会继续降。对想自部署的人是坏消息,显存门槛跟着总量走。

**中间档会变得更重要。**200B 到 300B 这一档,刚好卡在单机 8 卡能装下的边界上,对企业自部署是最实用的尺寸。我猜各家会在这个区间投入更多。

**量化和卸载技术的价值在上升。**当模型大到单机装不下,能把门槛压回单机的技术就值钱。这块现在还比较糙。

几句边界

模型规格来自 DeepSeek 官方发布和模型卡口径。效率数据(27% FLOPs、10% KV cache)引自其技术报告,是官方口径,未经第三方复现验证。

显存的账是我按公开参数自己算的,算式在正文里,可以自行验算。只算了权重部分,KV cache、激活值和框架开销未计入,实际部署需求高于这个数。

首周下载量来自公开报道,未经官方确认。

不同推理框架、不同并行策略下的实际显存占用会有差异,文中的单机配置对照只是量级参考,不能当部署方案。