刚刚!DeepSeek V4.1 Flash 发布:又降价了!闲时半价、V4 Pro 直接下线

4 阅读1分钟

发布日期:2026-09-10 | 标签:DeepSeek V4.1 Flash、Causal Encoder-Decoder、KV Cache 压缩、MoE、大模型 API 定价、Agent 编程

DeepSeek V4.1 Flash 是 DeepSeek 于 2026 年 9 月 10 日发布并以 MIT 许可开源的多模态 MoE 模型,总参数 552B,采用全新的 Causal Encoder-Decoder(CED)非对称结构,输入阶段每 token 只激活 8B 参数、输出阶段激活 16B,支持 100 万 token 上下文并原生具备视觉理解能力。技术报告显示,它在 DeepSWE v1.1、Terminal-Bench 2.1、Automation-Bench 等 Agent 基准上超过 DeepSeek V4 Pro,部分项目高于 Opus 5 和 GPT-5.6 Sol;同时全局 KV Cache 压到每 token 890 字节,对 HBM 的需求降为上一代 V4 Flash 的 1/4,对 SSD 的需求降为 1/8。API 侧模型名统一为 deepseek-flash,高峰时段输出价 8 元每百万 token,闲时减半,并发上限 2500;V4 Pro 将于 9 月 14 日 12:00 起被路由到 V4.1 Flash 并按 Flash 单价计费。本文基于 DeepSeek 官方发布文、51 页技术报告、API 定价页和 Hugging Face 仓库,拆解 V4.1 Flash 的结构创新、基准表现、定价变化与接入方式,并说明它对国内多模型平台格局的影响。

DeepSeek V4.1 Flash 是什么

DeepSeek V4.1 Flash 是 DeepSeek "全新模型结构系列"中尺寸最小的一款,官方发布文用三个词概括:更强、更快、更普惠。它是一个 552B 参数的多模态 MoE 模型,原生支持图像理解,上下文 100 万 token,最大输出 384K,以 MIT 许可在 Hugging Face 开源。

官方对新结构系列的设计目标是四条:能力上限更高、推理速度更快、吞吐更大、可扩展到更大参数模型。技术报告的标题则直接点出核心工程主题:Pushing the Limits of KV Cache Compression(把 KV Cache 压缩推到极限)。

发布同日的关键事实:

  • Hugging Face 仓库 deepseek-ai/DeepSeek-V4.1-Flash 于 2026 年 9 月 10 日 02:17(UTC)创建,含 51 页技术报告、prompt 编码参考和最小化 PyTorch 推理实现
  • config.json 显示 40 层、384 个路由专家、每 token 激活 6 个、1 个共享专家,最大位置编码 1,048,576,专家权重为 FP4
  • 腾讯 WorkBuddy、CodeBuddy 和 OpenCode 作为官方合作伙伴已全量接入
  • Hacker News 上"DeepSeek launching v4.1 flash cheaper and more capable than v4 pro"一帖在 9 月 9 日获得 399 分

非对称结构:输入 8B、输出 16B 的 Causal Encoder-Decoder

CED 结构让模型在读输入和写输出时激活不同规模的参数,这是 V4.1 Flash 成本优势的第一来源。

传统 Decoder-only 模型对 prefill(读入提示词)和 decode(逐 token 生成)使用同一套参数量。DeepSeek 技术报告指出,长程 Agent 的普及让工作负载越来越"输入重":一次任务里读入的工具输出、文件、历史对话远多于模型自己生成的内容,prefill 的计算开销和 KV Cache 的存储开销成为降本的主要瓶颈。

CED 的解法是把两阶段拆开:

阶段

每 token 激活参数

对应工作

Prefill(输入编码)

8B

读取提示词、工具返回、文档、图片

Decode(输出解码)

16B

生成推理链、代码、回复

官方发布文的表述是"输入和输出不对称,成本显著低于已知的同尺寸模型"。配合更大规模的强化学习后训练,V4.1 Flash 在基准上"成功超越了包括 DeepSeek V4 Pro 在内的一众旗舰模型"。

除 CED 外,技术报告列出的结构组件还包括:Compressed Sparse Attention 2(CSA2,含跨层 KV 与索引复用、分层稀疏索引器)、Single-Pass mHC、Engram n-gram 查表、DSpark 前向路径,以及 FP4 主 KV Cache。预训练语料为 45T token 多模态数据。

KV Cache 缩到 890 字节每 token:HBM 需求 1/4、SSD 需求 1/8

V4.1 Flash 的全局 KV Cache 为每 token 890 字节,约为 V4 Flash 的四分之一,相对初代 DeepSeek 模型缩小了 437 倍。

技术报告把 KV Cache 分为两类并分别优化:

  1. 全局 KV Cache(常驻 HBM):通过 CSA2 的跨层复用加 FP4 量化,压到 890 字节每 token,约为 V4 Flash 的 1/4
  2. 持久 KV Cache(常驻 SSD 或主机内存):通过名为 SWA Bounded Replay 的部署优化,降到 V4 Flash 的约 1/8

官方发布文解释了这为什么直接关系到账单:"在 Agent 使用场景中,缓存命中的费用往往占比较高,对 KV Cache 的压缩大幅降低了 Agent 类任务的使用成本。"新定价中缓存命中输入价为 0.04 元每百万 token(高峰),是缓存未命中价的五十分之一,正是这一压缩的直接体现。

基准表现:Agent 任务全面超越 V4 Pro

技术报告表 3 给出 V4.1 Flash 与 Opus 5、GPT-5.6 Sol、Kimi K3、GLM-5.3、DeepSeek V4 Pro、V4 Flash 的对比,全部为 Max 推理档。节选如下:

三个值得注意的读法:

  • Agent 编程是强项:DeepSWE v1.1 从 V4 Flash 的 54.4 跳到 74.2,超过 Opus 5 的 74.0;Terminal-Bench 2.1 的 90.6 是七个模型中最高
  • 纯推理仍有差距:HLE 36.8 明显低于 Opus 5 的 56.3;Terminal-Bench 4.0 的 31.2 与 Opus 5 的 51.8 差距较大
  • 跨框架稳定:报告表 4 在 Claude Code、Codex、OpenCode、Pi、mini-SWE、DeepSeek Harness 六个脚手架上测试,DeepSWE v1.1 得分在 65.5 到 74.2 之间,说明能力不绑定单一 harness

报告还公开了 reasoning effort 的量化影响:把 effort 从 25 提到 100,八项推理基准平均 Pass@1 从 67.1% 升到 76.3%,输出 token 增加约 2.5 倍;60 到 80 区间已恢复大部分精度但只用不到一半 token 预算。公开 API 提供 low / high / max 三档,分别对应 effort 50 / 75 / 100。

API 定价与模型路由变化

新价格自 2026 年 9 月 10 日 12:00 生效,闲时为高峰价的一半。

项目

deepseek-flash(V4.1 Flash)

deepseek-v4-pro(V4-Pro-0813)

输入·缓存命中

高峰 0.04 元 / 闲时 0.02 元

高峰 0.30 元 / 闲时 0.15 元

输入·缓存未命中

高峰 2 元 / 闲时 1 元

高峰 9 元 / 闲时 4.5 元

输出

高峰 8 元 / 闲时 4 元

高峰 27 元 / 闲时 13.5 元

上下文 / 最大输出

1M / 384K

1M / 384K

图像理解

支持

不支持

并发上限

2500

500

单位均为元每百万 token。高峰时段为北京时间周一至周五 9:00–12:00 和 14:00–18:00,其余均为闲时。

模型名与路由规则:

  1. 调用最新模型统一使用 deepseek-flash
  2. 旧名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 暂时路由到 V4.1 Flash,旧模型 V4 Flash 与 V4 Flash Vision Exp 已下线
  3. 北京时间 2026 年 9 月 14 日 12:00 起,deepseek-v4-pro 请求全部路由到 V4.1 Flash,按 Flash 单价计费,直到未来 V4.1 Pro 上线

官方给出的下线理由是:"经多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro。"以输出价计,从 V4 Pro 迁到 V4.1 Flash 的成本约降为原来的 30%。

如何接入

DeepSeek API 同时提供 OpenAI 与 Anthropic 两种格式,把模型名改为 deepseek-flash 即可。

from openai import OpenAI

client = OpenAI(
    base_url="https://api.deepseek.com",
    api_key="YOUR_DEEPSEEK_API_KEY",
)

resp = client.chat.completions.create(
    model="deepseek-flash",
    messages=[{"role": "user", "content": "用一句话解释 Causal Encoder-Decoder 结构"}],
)
print(resp.choices[0].message.content)

Anthropic 格式的 base_url 为 api.deepseek.com/anthropic,可直接供 Claude Code 一类工具使用。

本地部署方面,官方仓库提供 inference/ 目录下的最小推理实现和权重转换脚本,并表示将"全力支持开源社区进行新模型的推理适配";有 2k 卡 GPU 和存储集群的大规模部署需求可直接联系 DeepSeek。截至 9 月 10 日,Hugging Face 页面显示尚无第三方推理服务商托管该模型。

对国内多模型平台的影响

V4.1 Flash 的定价与路由变化会在数日内传导到各家模型广场,选型时需要关注三件事。

  • 模型 ID 对齐:DeepSeek 官方已改用 deepseek-flash 这一不带版本号的名称,第三方平台通常沿用带日期或版本的 ID。以 9 月 10 日的抓取为例,七牛云 AI 大模型广场当前在线的是 DeepSeek-V4-Pro-0813、DeepSeek-V4-Flash-20260731 和 DeepSeek-V4-Flash-Vision-Exp,并同样区分缓存 / 非缓存与高峰 / 闲时四档单价,V4.1 Flash 何时上架需以平台公告为准
  • V4 Pro 路由:9 月 14 日后官方接口的 deepseek-v4-pro 实际返回 V4.1 Flash,若业务依赖 V4 Pro 的特定行为,应在此之前完成回归测试
  • 峰谷调度:闲时半价对批处理、离线评测、夜间 Agent 任务有直接意义,值得在任务调度层加入时段判断

常见问题

V4.1 Flash 和 V4 Flash 有什么区别?

结构上从 Decoder-only 换成 Causal Encoder-Decoder,输入激活降到 8B;KV Cache 缩到约 1/4;原生支持图像输入,不再需要单独的 Vision Exp 版本;DeepSWE v1.1 从 54.4 升到 74.2,Terminal-Bench 2.1 从 82.7 升到 90.6。

为什么 V4 Pro 会被 Flash 取代?

官方称多方测试显示 V4.1 Flash 在性能、费用、速度、总用时上全面超越 V4 Pro。技术报告表 3 中,V4.1 Flash 在 Agent 类基准上普遍高于 V4 Pro,纯推理基准(如 GPQA Diamond、HLE)略低。9 月 14 日 12:00 后 V4 Pro 请求将路由到 V4.1 Flash,直到 V4.1 Pro 上线。

552B 和 Hugging Face 显示的 485B 哪个对?

技术报告和官方发布文均为 552B backbone 参数。Hugging Face 页面的 485B 来自 Safetensors 元数据自动统计,受 FP8 / FP4 混合精度和多模态组件计数方式影响,以论文数字为准。

闲时价怎么算?

高峰时段为北京时间周一至周五 9:00–12:00、14:00–18:00,其余时间(含周末)为闲时,所有档位单价减半。计费按请求完成时刻所在时段判定,具体以 DeepSeek 定价页为准。

能在本地跑吗?

可以,MIT 许可,官方提供最小 PyTorch 推理实现。但 552B 总参数加 100 万上下文对显存与存储要求很高,官方对大规模部署的表述是"2k 卡 GPU、有存储集群",个人设备不现实。

结语

DeepSeek V4.1 Flash 用非对称结构和 KV Cache 压缩把"更强"和"更便宜"同时做到,并用它替换掉了自家的旗舰 V4 Pro,这在近两年的模型迭代中并不常见。本文数据来自 DeepSeek 官方发布文、技术报告 DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression、DeepSeek API 定价页和 Hugging Face 仓库,均采集于 2026 年 9 月 10 日;价格与路由规则以官方页面实时信息为准。