DeepSeek(深度求索)

公司介绍

DeepSeek(深度求索)是一家中国 AI 创业公司,成立于 2023 年,专注于开发高性能的大语言模型。公司以开源和极致性价比著称,其模型在多个国际评测中达到世界顶级水平。DeepSeek 的母公司是量化私募幻方量化(High-Flyer)。

核心模型系列

DeepSeek V4.1 Flash(2026 年 9 月 10 日发布)

V4 系列的 Flash 升级版,官方宣布在性能、费用、速度、总用时各项指标上全面超越 V4 Pro。正式发布后模型 ID 定为 deepseek-flash。

⚠️ V4 Pro 原定 2026-09-14 12:00 下线,但截至 2026-10-01 官方价格页显示 deepseek-v4-pro 仍在售(版本 DeepSeek-V4-Pro-0813)。以官方实时文档为准。

DeepSeek V4(2026 年 4 月 24 日发布)

DeepSeek-V4 是目前的旗舰系列,拥有百万字超长上下文,在 Agent 能力、世界知识和推理性能上均实现国内与开源领域的领先。模型按大小分为两个版本:

版本总参数激活参数定位
DeepSeek-V4-Pro1.6T(1.6 万亿)49B性能比肩顶级闭源模型
DeepSeek-V4-Flash285B13B更快捷、经济的选择

DeepSeek V3(2025 年 12 月发布)

  • MoE 架构,总参数 671B,激活 37B
  • 强化 Agent 能力,融入思考推理
  • 支持 128K 上下文

DeepSeek R1(2025 年 1 月发布)

  • 推理模型,主打复杂推理能力
  • 开源,Apache 2.0 协议

V4 结构创新

混合注意力架构(Hybrid Attention)

结合 Compressed Sparse Attention(CSA) 和 Heavily Compressed Attention(HCA),大幅提高长上下文效率:

  • CSA:沿序列维度压缩 KV cache,应用 DeepSeek Sparse Attention(DSA)
  • HCA:以更大压缩率进行密集注意力计算

流形约束超连接(mHC)

将残差映射约束到双随机矩阵的流形上(Birkhoff polytope),增强信号传播稳定性,同时保持模型表达能力。

Muon 优化器

采用 Muon 优化器实现更快收敛和更好的训练稳定性。

多 Token 预测(MTP)

延续 V3 的 MTP 策略,加速文本生成并提升质量。

V4 能力表现

Agent 能力

相比前代模型,DeepSeek-V4-Pro 的 Agent 能力显著增强。在 Agentic Coding 评测中,V4-Pro 已达到当前开源模型最佳水平,并在其他 Agent 相关评测中同样表现优异。目前 DeepSeek-V4 已成为公司内部员工使用的 Agentic Coding 模型,据评测反馈使用体验优于 Sonnet 4.5,交付质量接近 Opus 4.6 非思考模式,但仍与 Opus 4.6 思考模式存在一定差距。

世界知识

DeepSeek-V4-Pro 在世界知识测评中,大幅领先其他开源模型,仅稍逊于顶尖闭源模型 Gemini-Pro-3.1。

推理性能

在数学、STEM、竞赛型代码的测评中,DeepSeek-V4-Pro 超越当前所有已公开评测的开源模型,取得了比肩世界顶级闭源模型的优异成绩。

三种推理模式

  • Non-think:快速、直觉式回答
  • Think High:深思熟虑的逻辑分析
  • Think Max:最大能力的延伸推理

API 接入(2026-10-01 官方核实)

DeepSeek API 同时支持 OpenAI ChatCompletions 接口与 Anthropic 接口。

BASE URL:

  • OpenAI 格式:https://api.deepseek.com
  • Anthropic 格式:https://api.deepseek.com/anthropic

当前在售模型(2026-10-01)

模型 ID模型版本上下文最大输出并发限制图像理解
deepseek-flashDeepSeek-V4.1-Flash1M384K2500✅ 支持
deepseek-v4-proDeepSeek-V4-Pro-08131M384K500❌ 不支持

⚠️ 旧模型名已下线:deepseek-v4-flash、deepseek-v4-flash-vision-exp 仍能调用,但对应模型已下线,请求由 V4.1-Flash 提供服务并按 Flash 价格计费。属于「兼容保留」而非「仍可用」,新代码直接用 deepseek-flash。

已完全停用:deepseek-chat、deepseek-reasoner(2026-07-24 停止使用)、deepseek-v4.1-flash-expires-on-0910(内测名)。

功能支持

两者均支持:Json Output、Tool Calls、Responses API、Anthropic API、对话前缀续写(Beta)、思考模式。
FIM 补全(Beta)仅非思考模式支持。

思考模式通过 reasoning_effort 参数设置强度(high/max),复杂 Agent 场景建议 max。

Agent 适配

DeepSeek-V4 针对 Claude Code、OpenClaw、OpenCode、CodeBuddy 等主流的 Agent 产品进行了适配和优化,在代码任务、文档生成任务等方面表现均有提升。

官方实用集成清单

  • 仓库:github.com/deepseek-ai/awesome-deepseek-integration(2026-09-12 查看约 169 个条目、16 个分类)
  • 是什么:DeepSeek 官方维护的「谁家软件支持 DeepSeek、怎么接入」大全——应用程序 84 个(Chatbox、Cherry Studio、LobeChat、钉钉 AI 助理、微信 RPA 客服等)、浏览器插件 20、即时通讯插件(飞书/QQ/钉钉/企微/Telegram/Discord)、Office 插件(Word/Excel/PPT/WPS)、各类代码编辑器插件、RAG/Agent 框架等
  • 对普通用户的用法:想找个现成软件填 API Key 就能用 DeepSeek 时,来这份清单按分类挑

付费模式

DeepSeek 采用按量付费模式,不提供包月套餐。此前有免费额度,但免费版已于 2026 年 8 月 20 日前后下架。

官方定价(2026-10-01 核实,单位:元/百万 tokens)

空闲时段价 = 高峰时段价的一半。高峰时段为北京时间周一至周五(不含中国法定节假日)9:00-12:00、14:00-18:00;其余时段(含周末及法定节假日全天)均为空闲时段。

计价项deepseek-flash 空闲deepseek-flash 高峰deepseek-v4-pro 空闲deepseek-v4-pro 高峰
输入(缓存命中)0.020.040.150.30
输入(缓存未命中)124.59.0
输出4813.527.0

⚠️ 旧价格已废弃:此前笔记记的美元价(V4-Flash $0.075/M 输入、V4-Pro $1.0/M 输入)和 UTC 时段分档都不再适用,官方已改为人民币、按北京时间高峰/空闲两档计价。

省钱用法:把批量任务排在周末或夜间,成本直接砍半。并发限制 Flash 2500 / Pro 500,个人用不会触顶。

扣费规则:费用直接从充值余额扣除;充值余额与赠送余额并存时优先扣赠送余额。价格可能变动,以 官方价格页 为准。

开源

DeepSeek-V4 模型开源链接:

技术报告:DeepSeek_V4.pdf

相关笔记

相关日记


附:DeepSeek V4 Flash(已下线型号档案)


tags: [工具, AI模型, DeepSeek, 开源]

created: 2026-09-08
updated: 2026-10-01

DeepSeek V4 Flash

⚠️ 已下线(2026-10-01 核实):模型 ID deepseek-v4-flash 对应的模型已下线,请求会被路由到 DeepSeek-V4.1-Flash(模型 ID deepseek-flash)并按 Flash 价格计费。属于「兼容保留」而非「仍可用」——新代码直接用 deepseek-flash。本篇仅作型号档案保留。

基本信息

  • 类型:DeepSeek-V4 系列的经济版模型(deepseek-v4-flash),与旗舰 V4-Pro 同代发布(2026-04-24)
  • 参数规模:285B 总参数 / 13B 激活(V4-Pro 为 1.6T / 49B)
  • 上下文:1M(100 万 tokens),最大输出 384K,支持非思考 / 思考模式(reasoning_effort:high / max)
  • ⚠️ 旧价格已废弃:此前记的 0.25/M 输出是美元旧价,官方现已改为人民币分时计价(见下方)

说人话版:它是干什么的

V4 家族里「快而便宜」的一档:能力略逊旗舰,但价格低一个数量级,适合跑量、当备胎分流。

现在它的位置:已经被 V4.1 Flash 完全接替,后者是同价位但能力更强的版本。V4 Flash 这个 ID 只是个转发壳。

现行价格(V4.1 Flash 接管后,人民币/百万 tokens)

计费项空闲时段高峰时段
输入(缓存命中)¥0.02¥0.04
输入(缓存未命中)¥1¥2
输出¥4¥8

空闲时段 = 高峰时段的一半。高峰时段为北京时间周一至周五(不含法定节假日)9:00-12:00、14:00-18:00;周末及节假日全天为空闲时段。并发限制 2500。

详见 DeepSeek V4.1 Flash。

与我们的关系(2026-09-08 确认,2026-10-01 复核)

  • 曾是用户主力模型组合中的备胎位:API 按量付费,GLM-5.3 Flash 涨价后的分流选项
  • 现状:配置早已切到 deepseek-flash(即 V4.1 Flash),本型号不再直接使用
  • 整体分工:MiniMax M3 包月管量活、GLM-5.3-Flash 管质量敏感的活、deepseek-flash 备胎

相关笔记

相关日记

  • 2026-09-08 - 确认为用户主力模型组合的备胎位
  • 2026-10-01 - 核实:模型已下线、旧美元价废弃,改为人民币分时价

附:DeepSeek V4.1 Flash(现行主力详解)


tags: [工具, AI模型, DeepSeek]

created: 2026-09-09
updated: 2026-10-01
source: https://www.deepseek.com

DeepSeek V4.1 Flash

当前状态(2026-10-01 核实):现行主力,模型 ID deepseek-flash,用户已配置在用。本篇记录的三处存疑已在本次核实中定论:价格口径冲突已解开(以调价通知为准,价格页现已同步)、高峰时段钟点已确认、V4 Pro 下线未发生。

基本信息

DeepSeek(深度求索)新一代 Flash 档模型,2026-09-10 正式发布并上线 API。09-08 起先有中间版本限时内测(模型 ID:deepseek-v4.1-flash-expires-on-0910,已过期停用)。

  • 官方模型 ID(重要):deepseek-flash —— 调用最新 V4.1 Flash 就用这个名字(已由用户完成配置)
  • 旧模型名去留:V4 Flash 与 V4 Flash Vision Exp 已下线,旧名 deepseek-v4-flash、deepseek-v4-flash-vision-exp仍可调用但会被路由到 V4.1 Flash,按 Flash 价格计费(官方说明为兼容保留,未来会废弃)
  • 模型定位:全新模型结构系列中尺寸最小的一款,结构设计目标是「能力上限更高、推理速度更快、吞吐更大、可扩展到更大参数模型」
  • 原生多模态:具备视觉理解能力(BabyVision 89.6、ZeroBench-main 49.0)——这是 V4.1 Flash 相比旧版最大的进步
  • 规格:上下文 1M,最大输出 384K,并发 2500
  • 功能支持:Json Output、Tool Calls、Responses API、Anthropic API、对话前缀续写;FIM 补全仅非思考模式支持
  • 官方口径:经内部、外部多方测试,在性能、费用、速度、总用时各项指标上全面超越 V4 Pro

官方基准成绩(2026-09-10 更新日志)

基准成绩说明
GPQA Diamond90.9研究生级科学问答
HLE36.8(39.1 纯文本子集)人类最后考试
Codeforces Rating3471竞赛编程
Terminal-Bench 2.190.6终端操作
Terminal-Bench 3.0 / 4.030.0 / 31.2新版终端基准
DeepSWE v1.174.2软件工程
SWE 相关(NL2Repo-Bench)65.4自然语言到仓库
CyberGym / SEC-Bench Pro88.1 / 62.8网络安全
HLE(带工具)63.9工具增强
Agents’ Last Exam31.8Agent 综合
Automation-Bench54.8自动化任务
Chartography(带工具)78.9图表理解

对照参考:上代 V4 Pro 的 Terminal Bench 2.1 为 87.9、HLE(带工具)60.0、NL2Repo 61.5 —— V4.1 Flash 在多项上确实反超。

官方价格

官方调价通知原文(2026-09-10 12:00 起,flash 系列)

我们将于北京时间 2026 年 9 月 10 日 12:00 起,调整 flash 系列定价:空闲时段输入缓存命中单价 0.02 元、输入缓存未命中单价 1 元,输出单价 4 元;高峰时段价格为空闲时段价格的 2 倍。

换算表格(每百万 tokens,人民币):

计费项空闲时段高峰时段
输入(缓存命中)¥0.02¥0.04
输入(缓存未命中)¥1¥2
输出¥4¥8
  • 降幅:缓存命中 -60%、未命中 -33%、输出 -11%(相对原空闲价 0.05 / 1.5 / 4.5)
  • ✅ 高峰时段钟点已确认(2026-10-01 官方价格页):北京时间周一至周五(不含中国法定节假日)9:00-12:00、14:00-18:00;其余时段含周末及法定节假日全天均为空闲时段

✅ 价格冲突已定论(2026-10-01 官方价格页复核)

09-10 记录的那个「通知说输出 ¥4、页面说 ¥2」的冲突,现已解开——两个数都对,只是口径不同:

空闲时段高峰时段
调价通知(09-10)¥4¥8
价格页(10-01 复核)¥4¥8

真相:09-10 那天价格页还是旧值(输出 ¥2、Pro ¥6),之后官方把价格页更新成了通知里的新价。以调价通知为准,价格页现已与之一致。

当前官方价格页(2026-10-01 抓取):

计费项deepseek-flash 空闲deepseek-flash 高峰deepseek-v4-pro 空闲deepseek-v4-pro 高峰
输入(缓存命中)¥0.02¥0.04¥0.15¥0.30
输入(缓存未命中)¥1¥2¥4.5¥9.0
输出¥4¥8¥13.5¥27.0
并发2500—500—

关键确认:

  • ✅ 高峰时段 = 空闲时段的 2 倍(此前记的「第三方报道口径」已被官方价格页确认,不再是未核实项)
  • ✅ 上下文 1M、最大输出 384K(两处一致)
  • ✅ 价格页列头已改为新模型名 deepseek-flash
  • ⚠️ 官方保留说明:价格可能变动,以官方价格页为准

V4 Pro 现状(重要更正)

⚠️ 此前记的「2026-09-14 12:00 V4 Pro 下线」并未发生。2026-10-01 官方价格页显示 deepseek-v4-pro 仍在售(版本 DeepSeek-V4-Pro-0813),并发限制 500。

原通知的内容是「计划下线」,最终没有执行。所以 V4 Pro 目前仍可正常调用,定价 ¥4.5/¥13.5(空闲)起,比 V4.1 Flash 贵一倍以上。

给用户的结论:V4.1 Flash 全面超越 V4 Pro(官方基准 + 第三方实测一致),且价格只有 V4 Pro 的一半不到——没有理由再用 V4 Pro,除非有依赖它独有能力的老代码。

对用户主力组合的影响(2026-10-01 更新)

  • 价格已不是劣势:输出 ¥4(空闲)/ ¥8(高峰),此前记的「对比 GLM-5.3 Flash 约 ¥3.6 略贵」是 09-10 的旧对比。现在 V4.1 Flash 的缓存命中输入 ¥0.02、并发 2500、输出上限 384K 都是硬优势,长前缀 Agent 任务成本极低
  • 真正的差异点:原生多模态(省掉 OCR 绕路)、输出上限 384K(GLM 128K)、并发 2500、缓存命中输入 ¥0.02
  • ⚠️ 成本控制提醒(第三方实测证实):V4.1 Flash 爱开多 Agent,复杂任务会自行拉起大量子 Agent,14 个任务实测花费比旧 V4 高 36%。大批量任务建议明确限制它不要自行开多 Agent
  • 长上下文仍需人工核对:写长报告时会出现前后数字矛盾(如首页 15.1%、图表 17.8%),关键数字要自己复核
  • 主力组合现状(2026-10-01):deepseek-flash(已配置生效) + MiniMax M3 包月不限量 + GLM-5.3 Flash

用户的实测情况(2026-09-10)

  • 用户已在用灰度测试版(即 deepseek-v4.1-flash-expires-on-0910)——先于正式发布上手
  • 正式发布时间:2026-09-10 中午 12:00(灰度代号里的 expires-on-0910 即到期转正之日)
  • ✅ 已正式切换并完成配置:用户已把模型名改为 deepseek-flash 并配置完成,DeepSeek V4.1 Flash 进入主力模型阵容
  • 已解决的历史疑点(2026-10-01):价格口径冲突、高峰时段钟点、V4 Pro 下线状态三处均已核实定论,不再存疑

第三方实测(2026-09-09/10 发布,两家独立评测)

夕小瑶科技说(虎嗅转载):14 组任务、累计 3 亿 token、deepseek harness 环境

明显变好的

  • 原生多模态是最大进步:同图解释任务,V4.1 约 5.7 秒完成,旧 V4 用了 200 秒;另一组 7.6 秒 vs 751 秒。原因是旧 Flash 要绕 OCR + 像素分析,V4.1 直接看图
  • 视觉推理:给三张参考图做游戏,V4.1 正确保留角色配色与关卡位置关系;V4 把 5×5 理解成 7×7、角色也做错
  • 前端可视化:孪生素数星系图,两边算出的 58980 对完全一致,但 V4.1 的螺旋星系能正常显示、可定位;V4 中央画布全黑
  • 速度:开测初期约 284 token/s vs 旧 V4 约 97 token/s(近 3 倍),但后半程差距收窄

没变好 / 反而更差的

  • 交付不一定更快:《星光邮局》V4.1 用了 34.5 分钟 vs 旧 V4 的 30.5 分钟——生成代码更快(15.5 min vs 23.4 min),但等工具运行的时间更长(18.7 min vs 6.6 min),把省下的时间花在自检验证上
  • 长上下文待进步:写 10 万字网文,V4.1 节奏拖沓(同一扫地动作来回写);同一份报告里首页写年化 15.1%、图表标 17.8%,数字自相矛盾
  • 花费可能更高:14 个任务 V4.1 花 ¥61.96 vs 旧 V4 ¥45.47(多 36%)——因为它爱开多 Agent,游戏+小说两题累计开了 37 个子 Agent、仅子任务就超 1 亿 token
  • 也有更省的任务:飞机建模 897 万 vs 1849 万 token;《星光邮局》805 万 vs 1461 万(省 45%)

作者结论(5 条):视觉理解进步明显;复杂任务易开多 Agent 导致 token 消耗多;数分与报告工程和 V4 几乎没区别;非视觉端到端任务完成时间无明显变化;长上下文理解仍有进步空间。

网易智能:3 个可运行应用(3D 停车游戏 / 小店 / 预约系统)

  • 代码生成速度:V4.1 三题分别 4:47、1:41、2:15,均为旧 V4 的 3-4 成用时(V4 分别 11:27、5:54、6:45)
  • 正确率:V4.1 三套应用全部通过检查;旧 V4 游戏画面上下颠倒(相机上方向算反)、小店重启后订单查询返回空
  • Token:预约系统一题输出少 14.4%、总 token 少 44.7%;三题合计输出少 14.4%、总 token 少 44.7%(但 V4 成品未完整,口径不完全可比)
  • 花费参考:V4.1 ¥5.55 vs V4 ¥5.41(基本持平,跨峰谷时段)

两家交叉验证的共识

维度结论来源
原生多模态 / 视觉理解大幅进步两家一致
代码生成速度显著变快(3-4 成用时)两家一致
代码正确率提升(网易:旧 V4 两题有 bug)网易
长上下文一致性仍弱(数字/细节前后矛盾)虎嗅
token 成本取决于任务:轻任务更省、重任务因多 Agent 更贵(多 36%)虎嗅;网易基本持平
端到端交付时间非视觉任务无明显改善虎嗅

使用提示:避免让它在大任务上自行开多 Agent(虎嗅实测多 Agent 是成本超支主因);长文档/长报告任务注意核对前后数字一致性。

相关笔记

  • DeepSeek - 公司与 V4 家族总览
  • DeepSeek V4 Flash - 上代经济版(本模型的替代对象之一)
  • GLM-5.3 - 当前质量敏感活主力(潜在被替代者)
  • MiniMax - M3 包月(量活位)

相关日记

  • 2026-09-09 - 发布官宣日,记录对主力模型组合的影响
  • 2026-09-10 - 正式发布日,记录官方价格与口径冲突
  • 2026-10-01 - 核实定论:价格冲突解开(以调价通知为准)、高峰时段钟点确认(周一至周五 9-12/14-18)、V4 Pro 下线未发生仍在售;补记成本控制提醒(爱开多 Agent 导致超支)