DeepSeek-V4 — 百万token上下文、开源发布
DeepSeek-V4为MoE模型系列,V4-Pro 1.6万亿参数(激活49B)、V4-Flash 2840亿参数(激活13B),均支持100万token上下文,MIT许可开源。4月24日发布的是预览版,V4-Flash正式版7月31日上线公测。
发布了什么
DeepSeek于2026年4月24日发布V4系列,官方公告标题即写明这是预览版(preview)。两个版本定位不同:V4-Pro面向高精度复杂任务,V4-Flash面向高频日常与成本敏感场景,1M上下文成为官方各项服务的默认配置。[3][6]
“4月24日发布”和“正式版”不是一回事——4月24日出的是预览版,V4-Flash正式版在7月31日下午通过API文档发布日志上线公测,当时官方表示V4-Pro正式版“将会尽快发布”。值得注意的是,V4-Flash-0731的模型结构与尺寸和preview版保持一致,仅重新进行了后训练——所以正式版的提升来自后训练,而不是换了更大的模型。[6][7]
“计算量27%、显存10%”是有条件的数字
这组数字被广泛引用,但常常被去掉条件。论文原文写的是“In the one-million-token context setting, DeepSeek-V4-Pro requires only 27% of single-token inference FLOPs and 10% of KV cache compared with DeepSeek-V3.2” — 即:①在100万token上下文场景下、②与V3.2相比、③指的是单token推理FLOPs与KV缓存。[3]
去掉条件说成“计算量降到27%、显存降到10%”会有两处失真:“显存占用”不等于“KV缓存”(KV缓存只是显存的一部分),而且短上下文场景不适用这个比例——效率优势正来自长上下文下的注意力压缩。[3]
百万上下文是怎么做到的
核心是混合注意力架构:CSA(压缩稀疏注意力)沿序列维度压缩KV缓存并执行稀疏注意力,HCA(高度压缩注意力)则更激进地压缩KV缓存但保持稠密注意力。两者配合,使100万token的长上下文在算力上变得可承受。[3][4]
此外还有两项改动:mHC(流形约束超连接)改进传统残差连接,Muon优化器用于加快收敛并提升训练稳定性;预训练数据规模超过32万亿token。另外,V4-Pro-Max并不是另一个模型,而是V4-Pro的最大推理强度模式。[3]
开放平台上实际能调用的三个模型
官方文档中的模型标识是`deepseek-v4-flash`、`deepseek-v4-pro`,以及`deepseek-v4-flash-vision-exp`。第三个是带视觉能力的实验版(exp)——多数中文介绍只提Pro和Flash两款,容易漏掉它;名称中的exp表示实验性质,接口与可用性可能变动。[5]
旧的`deepseek-chat`、`deepseek-reasoner`不是V4系列的标识。价格以开放平台公布的价目为准——本文未能从官方定价页取得完整价目表,因此不在此列出具体数字。[5][6]
已核实的事实
每条事实标注其证据类型本节每条事实都标注了证据类型——独立来源交叉核实,或一次原始记录单独确认。
DeepSeek-V4系列为混合专家(MoE)模型,V4-Pro为1.6万亿参数(激活49B)、V4-Flash为2840亿参数(激活13B),两者均支持100万token上下文。[3][4][6] 交叉 3 源 · 独立
2026年4月24日发布的V4系列为预览版,DeepSeek官方公告以“预览版”表述。[3][6] 交叉 2 源 · 独立
DeepSeek-V4-Flash正式版API于2026年7月31日下午上线公测,其模型结构与尺寸和预览版一致,仅重新进行了后训练。[6][7] 交叉 2 源 · 独立
DeepSeek-V4-Pro的模型权重以MIT许可证在Hugging Face公开发布。[3][4] 交叉 2 源 · 独立
V4采用结合压缩稀疏注意力(CSA)与高度压缩注意力(HCA)的混合注意力架构,并使用mHC残差连接与Muon优化器,预训练数据超过32万亿token。[3][4] 交叉 2 源 · 独立
报道中的说法
未经交叉核实 — 请勿当作事实自此开始为未经交叉核实的说法与推测。
技术媒体报道称V4-Flash输入价格最低0.2元/百万token;本文未能从官方定价页取得价目表,实际价格以DeepSeek开放平台公布为准。[2] 单一来源 ×1 · 中文技术媒体报道(单一来源)
有报道称华为、寒武纪等厂商已适配V4;该说法未在DeepSeek官方材料中确认。[2] 单一来源 ×1 · 技术媒体报道(单一来源)
DeepSeek开放平台的模型标识为deepseek-v4-flash、deepseek-v4-pro与deepseek-v4-flash-vision-exp。[5][6] 单一来源 ×2 · 单一机构来源:DeepSeek 开放平台(官方文档)・DeepSeek 开放平台 新闻(官方)
时间线
- 模型
- claude-fable-5
- 时间
- 2026/08/18 12:35
- 正文字数
- 1,084
- 资料来源
- 采用来源 6 条
- 模型
- claude-fable-5 (审核通过)
- 时间
- 2026/08/18 12:50
- 结论
- 通过
查看修订记录(4条)
| 2026/08/18 12:35 | 首次撰写(claude-fable-5) | 创建 |
| 2026/08/18 | 新建文档。DeepSeek新版本是长期被检索的技术里程碑。发布日与100万上下文由英文百科+中文技术媒体交叉;正式版日期/参数(英文百科)与性能/价格(中文媒体)各为单一来源,分层为主张。"4/24=发布"与"4/24=预览"的时间线差异如实并记。 | 更新 |
| 2026/09/20 | 来源标题原本混入了本文语言以外的说明文字,已改为打开页面后确认到的原始标题。正文与数字未作改动。 | 更新 |
| 2026/09/20 | 来源栏的说明文字原本用了本文语言以外的文字,已改为本文语言。机构名称保持原样,正文与数字未作改动。 | 更新 |
常见问题
V4是什么时候发布的?正式版呢?
2026年4月24日发布的是预览版。V4-Flash正式版API于7月31日下午上线公测,当时官方表示V4-Pro正式版将“尽快发布”。V4-Flash正式版与预览版的结构和尺寸一致,只是重新做了后训练。[6][7]
V4-Pro和V4-Flash差在哪?
都是MoE模型,都支持100万token上下文。V4-Pro为1.6万亿参数(激活49B),面向高精度复杂任务;V4-Flash为2840亿参数(激活13B),面向高频日常与成本敏感场景。[3][4]
“计算量降到27%、显存降到10%”是真的吗?
有条件。论文说的是在100万token上下文场景下、与DeepSeek-V3.2相比,单token推理FLOPs为27%、KV缓存为10%。短上下文不适用这个比例,而且KV缓存不等于全部显存占用。[3]
开源吗?用什么许可证?
V4-Pro的模型权重在Hugging Face以MIT许可证公开发布。[4]
API里该调用哪个模型名?
官方文档列出deepseek-v4-flash、deepseek-v4-pro与deepseek-v4-flash-vision-exp三个标识,第三个是带视觉能力的实验版。旧的deepseek-chat、deepseek-reasoner不是V4的标识。[5][6]
V4-Pro-Max是另一个模型吗?
不是。它是V4-Pro的最大推理强度(maximum reasoning effort)模式。[3]
官方链接
- 官方 DeepSeek
资料来源
- [2] DeepSeek正式发布全新V4系列:百万上下文普惠时代
- [3] DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence 一手来源
- [4] deepseek-ai/DeepSeek-V4-Pro · Hugging Face 一手来源
- [5] DeepSeek API Docs — Your First API Call 一手来源
- [6] DeepSeek-V4 预览版:迈入百万上下文普惠时代 一手来源
- [7] DeepSeek-V4-Flash 正式版 API 上线公测,V4-Pro 正式版将“尽快”发布