发布日期:2026-08-31
DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek 在 2026 年 8 月 31 日公开的 V4 家族首个实验性多模态模型,它在 DeepSeek-V4-Flash 架构上加入视觉模块并继续训练,支持把图片与文字交错放入同一条提示中。官方 Hugging Face 模型卡显示,该模型在多模态 Agent 任务上明显优于 DeepSeek-V4-Flash-0731,同时保持相近的纯文本 Agent 表现;仓库还开放了 MIT 许可证、编码参考、权重索引和最小 PyTorch 推理代码。本文从“开源了什么、能力如何看、怎样本地验证、能否用于生产”四个问题展开,给出一套不依赖黑盒服务的上手路径,并解释 304.6B 级参数、FP4 专家权重和 48 个 safetensors 分片对硬件规划意味着什么。需要强调的是,Vision-Exp 是实验性参考实现,官方代码适合理解和验证模型链路,生产服务仍需自行完成并行、显存、队列和安全治理。
先给结论:这次开源的核心是什么
DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek-V4 系列首个实验性原生多模态模型,官方模型卡确认它在 V4-Flash 基础上加入视觉模块,并开放了从图片提示编码到 PyTorch 前向推理的参考实现。
这不是把图片先交给外部 OCR 再调用文本模型,而是把 Vision Encoder、Aligner、DFlash Attention、MoE、Hyper-Connections 和 DSpark forward path 放进同一份参考代码中。模型可以理解图片内容,也可以在同一个上下文里继续完成工具调用或代码任务。
为什么这个发布值得关注
第一,开源边界更完整。 Hugging Face 仓库不只有模型卡,还包含 encoding/、inference/、视觉示例图片和权重索引,开发者可以复现“消息格式化—图像预处理—生成”的完整链路。
第二,多模态能力直接对准 Agent 场景。 官方对比中,Vision-Exp 在 ApexBench、Agents' Last Exam、Chartography 和 ZeroBench 等任务上均提供了多模态成绩,而上一代 V4-Flash-0731 在前两个任务中会忽略多模态输入。
第三,仍然保留文本 Agent 能力。 模型卡的说明是:Vision-Exp 相比 V4-Flash-0731 在多模态 Agent 能力上有明显提升,同时纯文本 Agent 任务保持可比表现。这意味着它的定位不是只能看图的专用模型,而是视觉能力增强后的通用 Agent 基座。
模型规格:先看清“实验性”和硬件门槛
截至 2026-08-31,Hugging Face API 返回的模型元数据显示:
项目
已核验信息
来源
官方名称
DeepSeek-V4-Flash-Vision-Exp
Hugging Face 模型卡,2026
发布性质
V4 家族首个实验性多模态模型
官方 README,2026
参数规模
约 304.6B(API safetensors.parameters.total)
Hugging Face API,2026
权重文件
48 个 safetensors 分片
Hugging Face 文件清单,2026
专家配置
num_experts_per_tok=6,专家 dtype 为 FP4
config.json,2026
量化信息
API 元数据标注 FP8 quantization config
Hugging Face API,2026
许可证
MIT
README 与 LICENSE,2026
304.6B 是总参数量,不等于每个 Token 都会激活全部参数。配置中的 MoE 专家路由和 FP4 专家权重可以降低单 Token 计算量,但不能把模型变成普通消费级显卡即可运行的小模型。48 个分片也意味着下载、校验和存储需要预留充足空间。
能力怎么看:四组官方基准给出什么信号
模型卡同时列出了文本 Agent 和多模态 Agent 两组结果。以下只摘录最能说明变化的项目,分数保持官方原值:
基准
Vision-Exp
V4-Flash-0731
任务含义
Terminal Bench 2.1
83.9
82.7
终端工具与代码执行
NL2Repo
57.7
54.2
自然语言到仓库修改
DeepSWE
59.3
54.4
软件工程 Agent
ApexBench(Pass@1)
36.5
26.2†
多模态 Agent 操作
Agents' Last Exam
27.3
25.2†
视觉与工具综合任务
Chartography
64.3
-
图表理解与操作
ZeroBench(Pass@5)
35.0
-
多模态泛化测试
† 官方注释指出,V4-Flash-0731 在 ApexBench 和 Agents' Last Exam 中会忽略输入里的多模态元素,因此这两项更适合用来观察“是否真正使用视觉信息”,不应简单当成同一条件下的纯模型竞技排名。
从结果可以得到三个比较稳妥的判断:
-
视觉模块带来的收益首先体现在需要看图、读图表和操作界面的任务。
-
文本 Agent 分数没有因为加入视觉模块而明显坍塌。
-
单一 benchmark 不能替代真实业务验收,尤其是 OCR 精度、长图切片和复杂 UI 操作仍需自行测试。
本地验证:从模型卡示例跑通第一张图
官方仓库把“提示编码”和“推理”拆成两个目录。这样做的好处是:即使你暂时没有足够 GPU,也可以先检查 OpenAI 风格消息是否被正确编码。
1. 安装推理依赖
git lfs install
git clone https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
cd DeepSeek-V4-Flash-Vision-Exp/inference
python -m pip install -r requirements.txt
模型约 304.6B 总参数,完整权重下载和运行前请先评估磁盘、显存、网络带宽与并行卡数。不要把上面的命令误解为“单卡即可运行”。
2. 转换为张量并行检查点
官方参考实现以 TP 检查点运行,示例使用 4 路模型并行:
export HF_CKPT_PATH=/path/to/DeepSeek-V4-Flash-Vision-Exp
export SAVE_PATH=/path/to/DeepSeek-V4-Flash-Vision-Exp-TP4
export MP=4
python convert.py \
--hf-ckpt-path "${HF_CKPT_PATH}" \
--save-path "${SAVE_PATH}" \
--n-experts 256 \
--model-parallel "${MP}" \
--expert-dtype fp4
convert.py 会把 tokenizer 文件复制到转换后的目录;如果 tokenizer 不在权重目录,可以额外传入 --tokenizer-path。
3. 运行 TXT 与 JSON 两种视觉提示
模型卡提供了等价的 TXT 和 JSON 示例,内容都是交错的两张图片问题:
export CKPT_PATH=/path/to/DeepSeek-V4-Flash-Vision-Exp-TP4
export MP=4
INPUT_FILE=examples/example_vl.txt ./run.sh
INPUT_FILE=examples/example_vl_harmony.json ./run.sh
两种格式会生成相同的编码提示和 input token IDs,适合用来排查“消息格式不一致”造成的结果差异。交互式对话则使用:
torchrun --nproc-per-node "${MP}" generate.py \
--ckpt-path "${CKPT_PATH}" \
--config config.json \
--interactive \
--temperature 1.0
多节点运行时,按 PyTorch 规范补充 --nnodes、--node-rank、--master-addr 和 --master-port。
接入业务前,先做三层验收
第一层:输入与视觉预处理
检查图片路径、格式、色彩空间和尺寸限制。建议准备收据、图表、网页截图和自然图片四类样本,分别记录是否出现裁切、旋转、低清和多图顺序错误。
第二层:Agent 工具闭环
仅能回答“图片里有什么”不等于多模态 Agent 可用。应增加“看截图—调用工具—修改文件—再次看结果”的闭环,验证模型是否会根据视觉反馈修正动作,而不是只输出一段解释。
第三层:服务工程指标
参考实现采用朴素的自回归生成循环,不是生产推理引擎。上线前需要补齐批处理、KV Cache 管理、超时、限流、监控、租户隔离和敏感图片处理。图片和中间结果若要异步保存,可把对象存储作为独立层,避免把大文件塞进会话数据库。
在国内团队的模型试验中,七牛云 AI 模型广场可作为多模型信息和版本入口;真正部署时仍需根据显存、并行策略、数据合规和延迟目标做压测,不能仅凭模型卡分数做选型。
与文本模型相比,什么时候值得用 Vision-Exp
需求
是否适合
原因
文本问答、摘要
可用但未必必要
视觉模块不会带来明显收益
图表分析、截图理解
适合验证
官方提供 Chartography 等成绩
视觉驱动的代码 Agent
值得重点测试
模型卡同时报告文本与多模态 Agent 能力
高并发生产 OCR
先做专项评测
参考实现不是生产服务,需自建优化
手机端或单卡本地运行
不适合作为默认方案
总参数和权重体量都很高
最合理的迁移路径是“先 API 或小规模离线评测,再决定是否自部署”。如果团队只需要图像问答,先比较端到端延迟和单位图片成本;如果需要视觉 Agent,则要把工具成功率和失败恢复纳入指标。
常见问题
DeepSeek-V4-Flash-Vision-Exp 是正式版吗?
不是。官方名称和 README 都使用 Exp,并明确称其为 V4 家族首个实验性多模态模型。它适合研究、验证和构建原型,生产稳定性需要后续版本或自建工程补齐。
这个模型是不是只支持图片?
当前公开示例以图片与文本交错输入为主,仓库提供视觉编码和图像预处理代码。是否支持视频、音频或更复杂媒体,应以未来模型卡和接口说明为准,不能从“多模态”三个字直接推断。
为什么模型卡里的两个旧模型分数不能直接横比?
因为官方注明 V4-Flash-0731 在部分多模态基准中忽略了视觉输入。对比时要先确认评测条件、Agent 框架、推理模式和是否真正读取图片。
没有 4 张高端 GPU 能不能试?
可以先做编码测试、阅读代码或使用远程推理服务;但官方参考推理示例采用 4 路模型并行,完整权重部署需要更高的显存和存储预算。不要把“开源”理解成“低硬件门槛”。
MIT 许可证是否意味着可以直接商用?
仓库 README 和 LICENSE 标注 MIT,但商用仍需核对依赖许可证、数据来源、模型输出风险和所在行业的合规要求。许可证解决的是授权边界,不等于替你完成安全评估。
结论:开源的是一条可复现的多模态 Agent 路径
DeepSeek-V4-Flash-Vision-Exp 的价值不只在于“首个多模态”标签,而在于它把视觉模块、提示编码、权重索引和最小推理路径一起公开,让开发者能够检查模型如何看图、如何进入 Agent 循环。官方基准显示,多模态任务提升与文本 Agent 能力保持,是这次发布最值得关注的信号。
但它仍是实验性模型,304.6B 级总参数、48 个权重分片和参考级推理代码决定了较高的部署门槛。本文信息截至 2026 年 8 月 31 日,具体版本、硬件兼容性和服务接口应以后续官方模型卡为准。