DeepSeek V4

DeepSeek-V4 是深度求索(DeepSeek)于 2026 年 4 月 24 日正式发布的开源旗舰模型,约 1 万亿参数 MoE 架构 + 100 万 token 长上下文 + CSA/HCA 混合注意力机制。在 Agent 能力、世界知识和推理性能三个核心维度达到开源最高水准,部分指标已比肩 Gemini 3.1 Pro、Claude Opus 4.6。


一、公司速览

深度求索

  • 公司全称:深度求索人工智能科技有限公司(DeepSeek AI)
  • 成立时间:2023 年 7 月
  • 总部:杭州
  • 创始人:梁文锋(量化基金幻方量化创始人)
  • 官网:deepseek.com
  • 定位:通用人工智能公司,以”极致效率 + 开源”为差异化能力

核心方向

  • DeepSeek 系列自研大模型
  • 差异化:从 V3 开始就是”开源 + 极致低成本”
  • 产品形态:API + 聊天产品 + 开源权重

二、产品矩阵

模型层

模型发布时间定位
DeepSeek-V4 系列2026-04-24最新旗舰开源
DeepSeek-V3.22025 末上一代旗舰
DeepSeek-V32024 末第三代
DeepSeek-R12025 初推理专精模型
DeepSeek-Coder持续编程专精模型

产品层

产品定位
DeepSeek ChatC 端对话产品
DeepSeek API极低价格 API
开源权重Hugging Face / GitHub

三、DeepSeek-V4 核心特性

3.1 模型规模

  • 约 1 万亿参数 MoE 架构(实际根据 Pro/Max/Flash 子版本不同)
  • 比 V3.2 显著扩展
  • MIT 协议完全开源 来源

3.2 长上下文

  • 100 万 token(1M)超长上下文窗口
  • 通过 CSA(Compressed Sparse Attention) + HCA(Hierarchical Compressed Attention) 混合注意力机制实现 来源
  • 推理 FLOPs 和 KV cache 大小相比 V3.2 显著优化

3.3 混合注意力架构

V4 的核心创新是 CSA + HCA 混合注意力:

  • CSA(Compressed Sparse Attention):局部稀疏注意力,处理近距离 token
  • HCA(Hierarchical Compressed Attention):分层压缩注意力,处理远距离 token
  • 两者优势叠加:长上下文效率革命性提升来源

3.4 工程代号

V4 发布前曾以工程代号 “MODEL1” 出现在 Flash 推理框架的测试日志里,引发社区猜测 来源。

3.5 双版本:V4-Pro 与 V4-Flash

  • V4-Pro:1.6T 总参数 / 49B 激活,性能比肩顶级闭源模型
  • V4-Flash:285B 总参数 / 13B 激活的经济版,API 模型名 deepseek-v4-flash;上下文同为 1M,支持非思考 / 思考模式(reasoning_effort:high / max)
  • Flash 官方定价:输入(缓存命中)0.02 元 / 百万 tokens,输入(缓存未命中)1 元 / 百万 tokens——约为 V4-Pro 标准价 12 元的 1/12,按量付费、无包月 官方价格页

四、能力评测

4.1 三大核心维度

维度DeepSeek-V4对比对象
Agent 能力开源最高部分指标比肩 Gemini 3.1 Pro / Claude Opus 4.6 来源
世界知识开源最高同上
推理性能开源最高同上

4.2 与闭源旗舰对比

V4 在多个核心指标上比肩(不是超过,是比肩)海外闭源旗舰:

  • Gemini 3.1 Pro(Google)
  • Claude Opus 4.6(Anthropic)

这意味着 V4 是开源阵营里第一个能与最顶级闭源模型正面竞争的模型之一来源。

4.3 评测意义

百万 token 上下文是开源模型的分水岭——之前只有闭源模型能做到。V4 把这个能力下放到开源,且效率革命性提升,是开源生态的重要节点 来源。


五、技术亮点

5.1 架构继承

V4 继承 V3 的多项设计:

  • MLA(Multi-head Latent Attention):减少 KV cache
  • **MoE 路由策略
  • FP8 训练:降低训练成本

5.2 V4 新增

新增作用
CSA 局部稀疏注意力近距离 token 高效处理
HCA 分层压缩注意力远距离 token 高效处理
百万级上下文原生支持不靠位置编码外推
KV cache 进一步压缩降低推理显存占用

来源


六、商业策略

6.1 价格

DeepSeek 一贯的极致低价路线:

  • V3 时代 API 价格就比 OpenAI 低一个数量级
  • V4 延续这个路线
  • 具体定价需查官方最新公告

6.2 开源策略

  • MIT 协议完全开源 来源
  • 权重在 Hugging Face 开放
  • 支持本地部署、二次训练、商用

6.3 对行业的影响

V4 发布再次证明了 “中国开源大模型可以比肩海外顶级闭源”——这是整个开源生态的胜利 来源。


七、国内大模型横向对标

模型公司上下文开源Agent 能力编程能力长上下文效率
DeepSeek V4深度求索1M✅ MIT⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐(CSA/HCA)
Kimi K3月之暗面4M✅⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐(KDA)
M3MiniMax1M✅⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐(MSA)
GLM-5.3智谱中长✅ MIT⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐

DeepSeek V4 的独特卖点:

  • MIT 协议最自由
  • 极致低价路线
  • CSA/HCA 混合注意力
  • 效率革命性提升

八、适合什么样的使用者

推荐用 DeepSeek V4 的场景

  • ✅ 本地私有部署:MIT 协议宽松
  • ✅ 成本敏感应用:API 价格仍是开源阵营最低之一
  • ✅ 长文档分析:百万级上下文原生支持
  • ✅ 需要二次训练:MIT 协议允许
  • ✅ 效率敏感场景:CSA/HCA 让推理更快

不太推荐用 DeepSeek V4 的场景

  • ❌ 顶级前端编程:Kimi K3 在 Frontend Arena 上领先
  • ❌ 超长上下文:Kimi K3 的 4M 更大
  • ❌ 多模态需求:V4 主打文本,多模态能力不如 M3 / GLM-5.3

九、常见问题

Q1:DeepSeek-V4 和 V3.2 怎么选?

  • V4 是当前最强版本
  • V3.2 在 V4 发布后逐渐成为”上代”
  • 全新项目推荐 V4

Q2:CSA/HCA 是什么意思?

  • CSA(Compressed Sparse Attention):局部稀疏注意力,处理近距离 token 关系
  • HCA(Hierarchical Compressed Attention):分层压缩注意力,处理远距离 token 关系
  • 两者混合实现百万级上下文高效推理

来源

Q3:DeepSeek 价格为什么这么低?

  • 早期用量化基金的高利润做补贴
  • 工程效率极高(V3 训练成本仅 558 万美元)
  • V4 延续”用技术降本”路线
  • 不靠涨价获取超额利润

Q4:DeepSeek V4 安全吗?

  • 完全开源可审查
  • 与 OpenAI、Anthropic 闭源不同,权重可下载检查
  • 但生成内容仍可能有偏见或错误,需要应用层防护

十、延伸阅读


十一、一句话总结

DeepSeek V4 是 2026 年开源大模型”长上下文 + 极致效率”维度的标杆——1T MoE + 百万级上下文 + CSA/HCA 混合注意力 + MIT 协议 + 极低价格,再次证明了”中国开源可以比肩海外顶级闭源”。如果你的项目需要本地私有化、成本敏感、长文档处理,DeepSeek V4 是当前最值得认真考虑的选项。

十二、V4.1 Flash(2026-09-10 前后正式发布)

2026-09-09 DeepSeek 开放平台发布官方通知:计划于北京时间 9 月 10 日前后正式发布 V4.1 Flash;9 月 8 日起中间版本限时内测(模型 ID:deepseek-v4.1-flash-expires-on-0910,9 月 10 日下线),内测期计费暂与 V4 Flash 相同。

  • 官方口径:经内部、外部多方测试,V4.1 Flash 在性能、费用、速度、总用时各项指标上全面超越 V4 Pro;采用全新模型结构,原生多模态支持
  • 过渡方案:V4.1 Flash 正式上线后、V4.1 Pro 上线前,对 V4 Pro 的请求全部路由到 V4.1 Flash,并按 V4.1 Flash 单价计费
  • Flash 系列新价格(9 月 10 日 12:00 起):空闲时段缓存命中输入 0.02 元 / 百万 tokens、缓存未命中输入 1 元 / 百万 tokens、输出 4 元 / 百万 tokens;高峰时段各项为空闲时段的 2 倍 来源(IT之家)

正式发布(2026-09-10 12:00):官方模型 ID 定为 deepseek-flash,调用最新 V4.1 Flash 即用此名(官方发布公告、官方更新日志)。旧模型 V4 Flash 与 V4 Flash Vision Exp 已下线,模型名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 出于兼容被暂时路由到 V4.1 Flash,未来将废弃。

  • 模型定位:全新模型结构系列中尺寸最小的一款,具备原生多模态视觉理解;设计目标为能力上限更高、推理速度更快、吞吐更大、可扩展到更大参数模型
  • 官方基准(更新日志 09-10):GPQA Diamond 90.9、Terminal-Bench 2.1 90.6(V4 Pro 为 87.9)、HLE 带工具 63.9(Pro 60.0)、NL2Repo-Bench 65.4(Pro 61.5)、DeepSWE v1.1 74.2、CyberGym 88.1 等多项反超上代 V4 Pro
  • V4 Pro 下线安排:北京时间 2026-09-14 12:00 之后至 V4.1 Pro 上线前,deepseek-v4-pro 请求全部路由到 V4.1 Flash 并按 Flash 单价计费;官方同步开放「V4 Pro vs V4.1 Flash」对比测试反馈通道
  • 规格与价格:上下文 1M、最大输出 384K、并发 2500;价格见官方模型与价格页

第三方实测(2026-09-10 前后,两家独立评测)

  • 虎嗅实测:14 组任务、累计 3 亿 token——原生多模态是最大进步(同图解释从旧版约 200 秒缩短到约 5.7 秒);重任务因模型自行开多 Agent(单题最多 37 个子 Agent)导致总花费反增约 36%,轻任务反而更省约 45%;长上下文一致性仍弱(同一报告数字前后矛盾)
  • 网易智能实测:3 套可运行应用——代码生成速度约为旧版的 3-4 成用时;旧 V4 两题出现 bug(游戏画面上下颠倒、小店订单查询失败),V4.1 三题全过
  • 使用建议:重任务明确约束模型自行开多 Agent 的倾向;长文档/长报告任务注意核对前后数字一致性