DeepSeek V4.1 Flash 部署完整指南:显存需求、vLLM/SGLang 启动命令与四条部署路线

2 阅读11分钟

发布日期:2026-09-10 | 适用读者:MLOps 工程师、私有化部署团队、想本地跑 DeepSeek 的开发者

DeepSeek V4.1 Flash 部署指的是把深度求索(DeepSeek)2026 年 9 月 10 日以 MIT 协议开源的 V4.1 Flash 多模态 MoE 模型权重,通过 vLLM、SGLang、官方参考实现或 llama.cpp 等推理框架在自有硬件上运行起来的完整过程。该模型权重原生为 FP8 加 FP4 混合量化,磁盘体积约 511GB,其中 196B 参数的 Engram 记忆表就占了约 189GiB,因此单机部署的门槛是一个 8 卡 H200 节点或一个 GB200 NVL4 托盘,vLLM 官方 recipe 给出的最低显存要求为 614GB。截至发布当天,vLLM 和 SGLang 均只提供专用预览镜像而非正式版 pip 包,llama.cpp 尚未合入 V4.1 架构支持,个人 Mac Studio 用户需要等待社区 3bit 以下量化版本。本文按"硬件评估、框架选型、启动参数、验证与排错、不自建的替代路线"五个环节整理了当前所有一手可查的部署信息,帮助团队在 2026 年 9 月判断是自建还是走 API。


部署前先看清:权重到底有多大

DeepSeek V4.1 Flash 的完整权重约 769B 参数、磁盘占用约 511GB,比模型卡上"552B 主干参数"的数字大出不少,原因是主干之外还有两块大体积组件。以下拆解来自 vLLM 官方 recipe(2026 年 9 月):

| 组件 | 参数量 | 存储占用(GiB) | 精度 |

|------|-------|---------------|------|

| 路由专家 + DSpark 草稿头专家 | 557.2B | 259.5 | MXFP4 |

| Engram 记忆表(第 1 层与第 14 层) | 196.6B | 188.8 | MXFP8 |

| 注意力、归一化、路由器 | 6.0B | 5.6 | MXFP8 |

| 词嵌入 + 输出头 | 3.0B | 5.8 | BF16 |

| 量化缩放因子 | 23.6B | 21.9 | UE8M0 |

三点对部署有直接影响:

  • Engram 表无法跳过:它是按 4-gram 哈希查表写入残差流的条件记忆,在推理时每个 token 都会访问,必须常驻显存。

  • 权重已是原生量化:HuggingFace 上的 48 个 safetensors 分片就是 FP8 密集权重加 FP4 专家权重,不需要也不建议再做 GPTQ/AWQ 二次量化。

  • 每 token 激活参数低:预填充 8B、解码 16B(vLLM 按含 Engram 口径统计为 15.5B),意味着一旦权重装进显存,吞吐和延迟表现会明显优于同体积密集模型。

硬件要求:单机门槛与已验证平台

单节点部署 DeepSeek V4.1 Flash 的显存底线是 614GB,这是 vLLM recipe 用 511GB 权重乘 1.2 倍余量得出的数字。已被官方或社区验证可跑的平台如下(vLLM recipe 与 SGLang cookbook,2026 年 9 月 10 日):

| 平台 | 单节点显存 | 验证状态 | 备注 |

|------|----------|---------|------|

| NVIDIA GB200 NVL4(1 托盘 4 卡) | 768GB | vLLM 已验证,TP4 | 官方默认硬件,文本模式 |

| NVIDIA GB300 | — | vLLM、SGLang 均已验证 | SGLang 低延迟/高吞吐两套配置 |

| NVIDIA H200(8 卡) | 1128GB | vLLM 已验证;SGLang 验证中 | 权重后剩余约 500GB 给 KV Cache |

| NVIDIA B200 / B300 | — | SGLang 验证中 | 使用预览镜像 |

| AMD MI350X(8 卡节点,用 4 卡) | — | vLLM、SGLang 均已验证 | 需 AITER 后端参数 |

| NVIDIA H100(8 卡,640GB) | 640GB | 未验证 | 显存刚过底线,1M 上下文不现实 |

关于上下文长度要有清醒预期。虽然模型支持 1M token,vLLM recipe 原文提醒"1M context will need the context or batch capped — measure before assuming",即即便在 H200 节点上也需要限制上下文或并发,不能默认满配。

四种部署路线怎么选

DeepSeek V4.1 Flash 目前有四条可行部署路线,成熟度和适用对象差别很大:

| 路线 | 当前状态(2026-09-10) | 适合谁 | 主要限制 |

|------|----------------------|-------|---------|

| vLLM 专用镜像 | 预览镜像 deepseekv41-flash-0909,需 vLLM 0.30.0+ | 生产服务、需要 OpenAI 兼容 API | 无 pip 包,架构支持 PR 尚未合入主线 |

| SGLang 预览镜像 | lmsysorg/sglang:dev-dsv41,cookbook 已合入文档 | 追求低延迟或高吞吐的调优团队 | 正式版尚未发布 |

| 官方参考实现 | 模型卡 inference 目录,torchrun 多卡 | 研究复现、验证数值 | 官方定性为"可读参考而非生产引擎" |

| llama.cpp / 社区量化 | V4 已支持,V4.1 架构尚无 PR | 单台 Mac Studio 或消费级多卡 | 需等待 GGUF 转换和 3bit 以下量化 |

选型建议:有 8 卡 H200 以上的团队直接走 vLLM 或 SGLang 镜像;只有一两张卡的开发者当前无法本地运行,应先用 API。

路线一:vLLM 镜像部署步骤

vLLM 是当前 DeepSeek V4.1 Flash 最完整的生产部署方案,官方 recipe 已给出验证过的参数。

第 1 步:拉取权重


pip install -U huggingface_hub

hf download deepseek-ai/DeepSeek-V4.1-Flash \

--local-dir /models/DeepSeek-V4.1-Flash

约 511GB,建议放在 NVMe 上,首次加载时间以小时计。

第 2 步:启动服务(NVIDIA,单机 TP4 或 TP8)


docker run --gpus all --ipc=host --shm-size 32g -p 8000:8000 \

-v /models:/models \

-e VLLM_ENGINE_READY_TIMEOUT_S=3600 \

-e VLLM_USE_RUST_FRONTEND=1 \

vllm/vllm-openai:deepseekv41-flash-0909 \

--model /models/DeepSeek-V4.1-Flash \

--served-model-name deepseek-ai/DeepSeek-V4.1-Flash \

--tokenizer-mode deepseek_v41 \

--tensor-parallel-size 8 \

--reasoning-parser deepseek_v41 \

--tool-call-parser deepseek_v41 --enable-auto-tool-choice \

--language-model-only

参数说明:

  • --tokenizer-mode deepseek_v41:V4.1 的提示词编码有专用格式,必须指定。

  • --reasoning-parser--tool-call-parser:V4.1 的工具调用用 DSML 标签块而非 JSON,解析器名称都是 deepseek_v41

  • --language-model-only:纯文本负载时跳过视觉编码器,把显存留给 KV Cache。需要图像输入时去掉此参数,可改加 --mm-encoder-tp-mode data,两者互斥。

  • VLLM_ENGINE_READY_TIMEOUT_S=3600:首次加载很慢,官方把就绪超时设为 1 小时。

第 3 步(可选):开启 DSpark 投机解码


--speculative-config '{"method":"dspark","num_speculative_tokens":5,"draft_sample_method":"probabilistic","rejection_sample_method":"block","enable_adaptive_verification":true}'

DSpark 是模型自带的三阶段草稿头,每轮起草 5 个 token,配合自适应验证可提升吞吐。

AMD MI350X 额外参数:加 --gpu-memory-utilization 0.9 --moe-backend aiter_triton_mxfp4_bf16,并设置环境变量 VLLM_ROCM_USE_AITER=1VLLM_ROCM_USE_AITER_MOE=1

路线二:SGLang 与官方参考实现

SGLang 为 DeepSeek V4.1 Flash 提供了"低延迟"和"高吞吐"两套预设,区别在于是否开启 DSpark。根据 2026 年 9 月 10 日合入的 cookbook,GB300 和 MI350X 的配置来自真实权重运行记录,H200、B200、B300 标注为"最终验证进行中"。预览镜像为 lmsysorg/sglang:dev-dsv41,MI350X 用 dev-dsv41-mi35x 标签;专家并行度在所有已测形态上都等于张量并行度。SGLang 明确不发布性能数字,理由是开发期测量条件不稳定,建议用户用 cookbook 附带的 speed 和 eval 命令自测。

官方参考实现走的是另一条路:需要先把 HuggingFace 权重转换成按张量并行 rank 切分的检查点,再用 torchrun 运行。


cd inference && python -m pip install -r requirements.txt

  


export HF_CKPT_PATH=/models/DeepSeek-V4.1-Flash

export SAVE_PATH=/models/DeepSeek-V4.1-Flash-TP8

export MP=8

  


python convert.py \

--hf-ckpt-path "${HF_CKPT_PATH}" \

--save-path "${SAVE_PATH}" \

--model-parallel "${MP}" \

--expert-dtype fp4 \

--tokenizer-path "${HF_CKPT_PATH}"

  


torchrun --nproc-per-node "${MP}" generate.py \

--ckpt-path "${SAVE_PATH}" --config config.json \

--interactive --temperature 0.6

依赖要求 torch 2.10 以上、safetensors 0.7 以上、tilelang 0.1.8。转换后的检查点命名为 model0-mp8.safetensorsmodel7-mp8.safetensors,run.sh 会逐个校验分片是否齐全。这条路线覆盖了视觉编码器、稀疏注意力索引器、Engram 查表和 DSpark 前向路径,但生成是朴素自回归采样,官方定位是读代码和验证数值,不是生产服务。

部署后验证:三件必查的事

服务起来之后,DeepSeek V4.1 Flash 有三个容易被误判为"模型坏了"的行为,需要逐一验证。

1. 思考模式默认开启,强度 50

两个思考参数都不传时,模型默认开启思考且推理强度为 50。如果同时 max_tokens 设得小,预算会全部花在思考链上,返回空 content 加 finish_reason=length。解决办法是显式关闭思考或放宽预算:


resp = client.chat.completions.create(

model="deepseek-ai/DeepSeek-V4.1-Flash",

messages=[{"role": "user", "content": "17*19 等于多少?只返回整数。"}],

extra_body={"chat_template_kwargs": {"thinking": True, "reasoning_effort": 25}},

)

reasoning_effort 接受 1 到 100 的整数,字符串别名对应 low=25、high=50、xhigh=75、max=100。vLLM 会拒绝 minimalmedium,因为它们不在该模型的取值集合中。正确答案应返回 323。

2. 图像路径要单独测

视觉编码器是独立分支,纯文本冒烟测试不会触及它。至少发一条带图片的请求,确认 <|deepseek_image|> 占位和 1024 token 每图的上限正常工作。单张图最小像素为 295,936,图片数量无上限。

3. 工具调用格式变了

V4.1 的 DSML 标签名带前导空格,例如 <|DSML| calls>,与 V4 的 <|DSML|tool_calls> 不兼容。自研解析器的团队需要按模型卡 encoding 目录的 encoding.py 更新,或直接换用 Rust 工具库 deepseek-recipe。

不自建:API 与云端接入路线

没有 8 卡节点的团队,当前唯一可行的方式是调用云端 API,成本也远低于自建。DeepSeek 官方 API 中 V4.1 Flash 的模型名为 deepseek-flash,非高峰时段输入每百万 token 0.15 美元、输出 0.60 美元,并发上限 2500。按这个价格,一台 8 卡 H200 服务器一年的折旧就相当于数十亿 token 的 API 调用量,只有持续高负载或数据合规硬约束的场景才值得自建。

多模型统一接入平台是另一种折中:应用侧用标准 OpenAI SDK 格式,只需替换 base_url 和模型 ID 即可在 DeepSeek 与其他国产模型之间切换。例如七牛云 AI 推理服务提供的接口地址为 https://api.qnaigc.com/v1,模型 ID 在控制台模型广场查询,同一套代码无需为每家厂商单独适配。这种方式适合需要做多模型对比或灰度切换的团队。

常见问题

Q:DeepSeek V4.1 Flash 本地部署最低需要什么显卡?

单机部署需要至少 614GB 显存,对应 8 卡 H200(1128GB)或 1 托盘 GB200 NVL4(768GB)。8 卡 H100 的 640GB 刚过底线但未经验证,且 1M 上下文不可用。单卡或双卡消费级显卡目前无法运行。

Q:Mac Studio 512GB 内存能跑 DeepSeek V4.1 Flash 吗?

目前不能。llama.cpp 尚未合入 V4.1 架构支持,没有 GGUF 版本。HN 上有用户报告用 3.2 bpw 量化在 Mac Studio 上跑上一代 V4 Flash 占用约 117GB,V4.1 Flash 因权重增大且含 196B Engram 表,即便有量化版本,内存占用也会显著高于 V4 Flash。[数据待核实:V4.1 Flash 量化后的实际内存占用需等社区 GGUF 发布]

Q:可以用 Ollama 部署 DeepSeek V4.1 Flash 吗?

暂时不行。Ollama 依赖 llama.cpp 后端,后者尚未支持 V4.1 架构。即便未来支持,社区反馈 Ollama 的结构化输出与工具调用、思考模式仍有兼容问题,生产 Agent 场景建议用 vLLM 或 SGLang。

Q:vLLM 部署 DeepSeek V4.1 Flash 为什么 pip install 装不上?

因为 V4.1 架构支持的 PR 截至 9 月 10 日仍处于 open 状态,尚未合入 vLLM 主线,没有任何 pip 版本包含它。官方要求使用专用 Docker 镜像 vllm/vllm-openai:deepseekv41-flash-0909,AMD 平台对应 vllm-openai-rocm 同标签。

Q:DeepSeek V4.1 Flash 部署时需要重新量化吗?

不需要。HuggingFace 发布的权重已是原生 MXFP4 专家加 MXFP8 密集权重的混合量化检查点,推理框架直接加载。二次量化会破坏 UE8M0 缩放因子体系,官方和 vLLM 均未提供该路径。

总结

DeepSeek V4.1 Flash 的部署门槛由 511GB 原生量化权重和必须常驻的 196B Engram 记忆表决定,单机底线是 614GB 显存,8 卡 H200 或 GB200 NVL4 是当前已验证的起点。生产部署选 vLLM 或 SGLang 的专用预览镜像,注意思考模式默认开启和 DSML 工具调用格式变化,纯文本负载加 --language-model-only 可省出显存给 KV Cache。

据 vLLM 官方 recipe 与 SGLang cookbook 表示,两个框架的 V4.1 Flash 支持均处于预览阶段,正式版发布后启动参数可能变化。本文内容基于 2026 年 9 月 10 日 HuggingFace 模型卡、vLLM recipes 仓库和 SGLang 文档 PR,建议部署前核对最新版本。