DeepSeek(深度求索)
公司介绍
DeepSeek(深度求索)是一家中国 AI 创业公司,成立于 2023 年,专注于开发高性能的大语言模型。公司以开源和极致性价比著称,其模型在多个国际评测中达到世界顶级水平。DeepSeek 的母公司是量化私募幻方量化(High-Flyer)。
核心模型系列
DeepSeek V4.1 Flash(2026 年 9 月 10 日发布)
V4 系列的 Flash 升级版,官方宣布在性能、费用、速度、总用时各项指标上全面超越 V4 Pro。正式发布后模型 ID 定为 deepseek-flash。
⚠️ V4 Pro 原定 2026-09-14 12:00 下线,但截至 2026-10-01 官方价格页显示
deepseek-v4-pro仍在售(版本 DeepSeek-V4-Pro-0813)。以官方实时文档为准。
DeepSeek V4(2026 年 4 月 24 日发布)
DeepSeek-V4 是目前的旗舰系列,拥有百万字超长上下文,在 Agent 能力、世界知识和推理性能上均实现国内与开源领域的领先。模型按大小分为两个版本:
| 版本 | 总参数 | 激活参数 | 定位 |
|---|---|---|---|
| DeepSeek-V4-Pro | 1.6T(1.6 万亿) | 49B | 性能比肩顶级闭源模型 |
| DeepSeek-V4-Flash | 285B | 13B | 更快捷、经济的选择 |
DeepSeek V3(2025 年 12 月发布)
- MoE 架构,总参数 671B,激活 37B
- 强化 Agent 能力,融入思考推理
- 支持 128K 上下文
DeepSeek R1(2025 年 1 月发布)
- 推理模型,主打复杂推理能力
- 开源,Apache 2.0 协议
V4 结构创新
混合注意力架构(Hybrid Attention)
结合 Compressed Sparse Attention(CSA) 和 Heavily Compressed Attention(HCA),大幅提高长上下文效率:
- CSA:沿序列维度压缩 KV cache,应用 DeepSeek Sparse Attention(DSA)
- HCA:以更大压缩率进行密集注意力计算
流形约束超连接(mHC)
将残差映射约束到双随机矩阵的流形上(Birkhoff polytope),增强信号传播稳定性,同时保持模型表达能力。
Muon 优化器
采用 Muon 优化器实现更快收敛和更好的训练稳定性。
多 Token 预测(MTP)
延续 V3 的 MTP 策略,加速文本生成并提升质量。
V4 能力表现
Agent 能力
相比前代模型,DeepSeek-V4-Pro 的 Agent 能力显著增强。在 Agentic Coding 评测中,V4-Pro 已达到当前开源模型最佳水平,并在其他 Agent 相关评测中同样表现优异。目前 DeepSeek-V4 已成为公司内部员工使用的 Agentic Coding 模型,据评测反馈使用体验优于 Sonnet 4.5,交付质量接近 Opus 4.6 非思考模式,但仍与 Opus 4.6 思考模式存在一定差距。
世界知识
DeepSeek-V4-Pro 在世界知识测评中,大幅领先其他开源模型,仅稍逊于顶尖闭源模型 Gemini-Pro-3.1。
推理性能
在数学、STEM、竞赛型代码的测评中,DeepSeek-V4-Pro 超越当前所有已公开评测的开源模型,取得了比肩世界顶级闭源模型的优异成绩。
三种推理模式
- Non-think:快速、直觉式回答
- Think High:深思熟虑的逻辑分析
- Think Max:最大能力的延伸推理
API 接入(2026-10-01 官方核实)
DeepSeek API 同时支持 OpenAI ChatCompletions 接口与 Anthropic 接口。
BASE URL:
- OpenAI 格式:
https://api.deepseek.com - Anthropic 格式:
https://api.deepseek.com/anthropic
当前在售模型(2026-10-01)
| 模型 ID | 模型版本 | 上下文 | 最大输出 | 并发限制 | 图像理解 |
|---|---|---|---|---|---|
deepseek-flash | DeepSeek-V4.1-Flash | 1M | 384K | 2500 | ✅ 支持 |
deepseek-v4-pro | DeepSeek-V4-Pro-0813 | 1M | 384K | 500 | ❌ 不支持 |
⚠️ 旧模型名已下线:deepseek-v4-flash、deepseek-v4-flash-vision-exp 仍能调用,但对应模型已下线,请求由 V4.1-Flash 提供服务并按 Flash 价格计费。属于「兼容保留」而非「仍可用」,新代码直接用 deepseek-flash。
已完全停用:deepseek-chat、deepseek-reasoner(2026-07-24 停止使用)、deepseek-v4.1-flash-expires-on-0910(内测名)。
功能支持
两者均支持:Json Output、Tool Calls、Responses API、Anthropic API、对话前缀续写(Beta)、思考模式。
FIM 补全(Beta)仅非思考模式支持。
思考模式通过 reasoning_effort 参数设置强度(high/max),复杂 Agent 场景建议 max。
Agent 适配
DeepSeek-V4 针对 Claude Code、OpenClaw、OpenCode、CodeBuddy 等主流的 Agent 产品进行了适配和优化,在代码任务、文档生成任务等方面表现均有提升。
官方实用集成清单
- 仓库:
github.com/deepseek-ai/awesome-deepseek-integration(2026-09-12 查看约 169 个条目、16 个分类) - 是什么:DeepSeek 官方维护的「谁家软件支持 DeepSeek、怎么接入」大全——应用程序 84 个(Chatbox、Cherry Studio、LobeChat、钉钉 AI 助理、微信 RPA 客服等)、浏览器插件 20、即时通讯插件(飞书/QQ/钉钉/企微/Telegram/Discord)、Office 插件(Word/Excel/PPT/WPS)、各类代码编辑器插件、RAG/Agent 框架等
- 对普通用户的用法:想找个现成软件填 API Key 就能用 DeepSeek 时,来这份清单按分类挑
付费模式
DeepSeek 采用按量付费模式,不提供包月套餐。此前有免费额度,但免费版已于 2026 年 8 月 20 日前后下架。
官方定价(2026-10-01 核实,单位:元/百万 tokens)
空闲时段价 = 高峰时段价的一半。高峰时段为北京时间周一至周五(不含中国法定节假日)9:00-12:00、14:00-18:00;其余时段(含周末及法定节假日全天)均为空闲时段。
| 计价项 | deepseek-flash 空闲 | deepseek-flash 高峰 | deepseek-v4-pro 空闲 | deepseek-v4-pro 高峰 |
|---|---|---|---|---|
| 输入(缓存命中) | 0.02 | 0.04 | 0.15 | 0.30 |
| 输入(缓存未命中) | 1 | 2 | 4.5 | 9.0 |
| 输出 | 4 | 8 | 13.5 | 27.0 |
⚠️ 旧价格已废弃:此前笔记记的美元价(V4-Flash $0.075/M 输入、V4-Pro $1.0/M 输入)和 UTC 时段分档都不再适用,官方已改为人民币、按北京时间高峰/空闲两档计价。
省钱用法:把批量任务排在周末或夜间,成本直接砍半。并发限制 Flash 2500 / Pro 500,个人用不会触顶。
扣费规则:费用直接从充值余额扣除;充值余额与赠送余额并存时优先扣赠送余额。价格可能变动,以 官方价格页 为准。
开源
DeepSeek-V4 模型开源链接:
技术报告:DeepSeek_V4.pdf
相关笔记
- TraeWork - 接入的目标
- DeepSeek Harness - DeepSeek 的 Agent 框架
- OpenRouter - 接入渠道
- Kimi K3 - 同级别模型
- MiniMax - 同级别模型
- API Keys - Key 存放处(私密)
相关日记
- 2026-08-24 - 记录当天
附:DeepSeek V4 Flash(已下线型号档案)
tags: [工具, AI模型, DeepSeek, 开源]
created: 2026-09-08
updated: 2026-10-01
DeepSeek V4 Flash
⚠️ 已下线(2026-10-01 核实):模型 ID
deepseek-v4-flash对应的模型已下线,请求会被路由到 DeepSeek-V4.1-Flash(模型 IDdeepseek-flash)并按 Flash 价格计费。属于「兼容保留」而非「仍可用」——新代码直接用deepseek-flash。本篇仅作型号档案保留。
基本信息
- 类型:DeepSeek-V4 系列的经济版模型(
deepseek-v4-flash),与旗舰 V4-Pro 同代发布(2026-04-24) - 参数规模:285B 总参数 / 13B 激活(V4-Pro 为 1.6T / 49B)
- 上下文:1M(100 万 tokens),最大输出 384K,支持非思考 / 思考模式(
reasoning_effort:high / max) - ⚠️ 旧价格已废弃:此前记的 0.25/M 输出是美元旧价,官方现已改为人民币分时计价(见下方)
说人话版:它是干什么的
V4 家族里「快而便宜」的一档:能力略逊旗舰,但价格低一个数量级,适合跑量、当备胎分流。
现在它的位置:已经被 V4.1 Flash 完全接替,后者是同价位但能力更强的版本。V4 Flash 这个 ID 只是个转发壳。
现行价格(V4.1 Flash 接管后,人民币/百万 tokens)
| 计费项 | 空闲时段 | 高峰时段 |
|---|---|---|
| 输入(缓存命中) | ¥0.02 | ¥0.04 |
| 输入(缓存未命中) | ¥1 | ¥2 |
| 输出 | ¥4 | ¥8 |
空闲时段 = 高峰时段的一半。高峰时段为北京时间周一至周五(不含法定节假日)9:00-12:00、14:00-18:00;周末及节假日全天为空闲时段。并发限制 2500。
与我们的关系(2026-09-08 确认,2026-10-01 复核)
- 曾是用户主力模型组合中的备胎位:API 按量付费,GLM-5.3 Flash 涨价后的分流选项
- 现状:配置早已切到
deepseek-flash(即 V4.1 Flash),本型号不再直接使用 - 整体分工:MiniMax M3 包月管量活、GLM-5.3-Flash 管质量敏感的活、
deepseek-flash备胎
相关笔记
- DeepSeek - 公司与 V4 家族总览(Pro / Flash 双版本、架构创新、API 接入)
- DeepSeek V4.1 Flash - 实际接替本型号的现行版本
- GLM-5.3 / MiniMax - 同梯队主力模型
相关日记
- 2026-09-08 - 确认为用户主力模型组合的备胎位
- 2026-10-01 - 核实:模型已下线、旧美元价废弃,改为人民币分时价
附:DeepSeek V4.1 Flash(现行主力详解)
tags: [工具, AI模型, DeepSeek]
created: 2026-09-09
updated: 2026-10-01
source: https://www.deepseek.com
DeepSeek V4.1 Flash
当前状态(2026-10-01 核实):现行主力,模型 ID
deepseek-flash,用户已配置在用。本篇记录的三处存疑已在本次核实中定论:价格口径冲突已解开(以调价通知为准,价格页现已同步)、高峰时段钟点已确认、V4 Pro 下线未发生。
基本信息
DeepSeek(深度求索)新一代 Flash 档模型,2026-09-10 正式发布并上线 API。09-08 起先有中间版本限时内测(模型 ID:deepseek-v4.1-flash-expires-on-0910,已过期停用)。
- 官方模型 ID(重要):
deepseek-flash—— 调用最新 V4.1 Flash 就用这个名字(已由用户完成配置) - 旧模型名去留:V4 Flash 与 V4 Flash Vision Exp 已下线,旧名
deepseek-v4-flash、deepseek-v4-flash-vision-exp仍可调用但会被路由到 V4.1 Flash,按 Flash 价格计费(官方说明为兼容保留,未来会废弃) - 模型定位:全新模型结构系列中尺寸最小的一款,结构设计目标是「能力上限更高、推理速度更快、吞吐更大、可扩展到更大参数模型」
- 原生多模态:具备视觉理解能力(BabyVision 89.6、ZeroBench-main 49.0)——这是 V4.1 Flash 相比旧版最大的进步
- 规格:上下文 1M,最大输出 384K,并发 2500
- 功能支持:Json Output、Tool Calls、Responses API、Anthropic API、对话前缀续写;FIM 补全仅非思考模式支持
- 官方口径:经内部、外部多方测试,在性能、费用、速度、总用时各项指标上全面超越 V4 Pro
官方基准成绩(2026-09-10 更新日志)
| 基准 | 成绩 | 说明 |
|---|---|---|
| GPQA Diamond | 90.9 | 研究生级科学问答 |
| HLE | 36.8(39.1 纯文本子集) | 人类最后考试 |
| Codeforces Rating | 3471 | 竞赛编程 |
| Terminal-Bench 2.1 | 90.6 | 终端操作 |
| Terminal-Bench 3.0 / 4.0 | 30.0 / 31.2 | 新版终端基准 |
| DeepSWE v1.1 | 74.2 | 软件工程 |
| SWE 相关(NL2Repo-Bench) | 65.4 | 自然语言到仓库 |
| CyberGym / SEC-Bench Pro | 88.1 / 62.8 | 网络安全 |
| HLE(带工具) | 63.9 | 工具增强 |
| Agents’ Last Exam | 31.8 | Agent 综合 |
| Automation-Bench | 54.8 | 自动化任务 |
| Chartography(带工具) | 78.9 | 图表理解 |
对照参考:上代 V4 Pro 的 Terminal Bench 2.1 为 87.9、HLE(带工具)60.0、NL2Repo 61.5 —— V4.1 Flash 在多项上确实反超。
官方价格
官方调价通知原文(2026-09-10 12:00 起,flash 系列)
我们将于北京时间 2026 年 9 月 10 日 12:00 起,调整 flash 系列定价:空闲时段输入缓存命中单价 0.02 元、输入缓存未命中单价 1 元,输出单价 4 元;高峰时段价格为空闲时段价格的 2 倍。
换算表格(每百万 tokens,人民币):
| 计费项 | 空闲时段 | 高峰时段 |
|---|---|---|
| 输入(缓存命中) | ¥0.02 | ¥0.04 |
| 输入(缓存未命中) | ¥1 | ¥2 |
| 输出 | ¥4 | ¥8 |
- 降幅:缓存命中 -60%、未命中 -33%、输出 -11%(相对原空闲价 0.05 / 1.5 / 4.5)
- ✅ 高峰时段钟点已确认(2026-10-01 官方价格页):北京时间周一至周五(不含中国法定节假日)9:00-12:00、14:00-18:00;其余时段含周末及法定节假日全天均为空闲时段
✅ 价格冲突已定论(2026-10-01 官方价格页复核)
09-10 记录的那个「通知说输出 ¥4、页面说 ¥2」的冲突,现已解开——两个数都对,只是口径不同:
| 空闲时段 | 高峰时段 | |
|---|---|---|
| 调价通知(09-10) | ¥4 | ¥8 |
| 价格页(10-01 复核) | ¥4 | ¥8 |
真相:09-10 那天价格页还是旧值(输出 ¥2、Pro ¥6),之后官方把价格页更新成了通知里的新价。以调价通知为准,价格页现已与之一致。
当前官方价格页(2026-10-01 抓取):
| 计费项 | deepseek-flash 空闲 | deepseek-flash 高峰 | deepseek-v4-pro 空闲 | deepseek-v4-pro 高峰 |
|---|---|---|---|---|
| 输入(缓存命中) | ¥0.02 | ¥0.04 | ¥0.15 | ¥0.30 |
| 输入(缓存未命中) | ¥1 | ¥2 | ¥4.5 | ¥9.0 |
| 输出 | ¥4 | ¥8 | ¥13.5 | ¥27.0 |
| 并发 | 2500 | — | 500 | — |
关键确认:
- ✅ 高峰时段 = 空闲时段的 2 倍(此前记的「第三方报道口径」已被官方价格页确认,不再是未核实项)
- ✅ 上下文 1M、最大输出 384K(两处一致)
- ✅ 价格页列头已改为新模型名
deepseek-flash - ⚠️ 官方保留说明:价格可能变动,以官方价格页为准
V4 Pro 现状(重要更正)
⚠️ 此前记的「2026-09-14 12:00 V4 Pro 下线」并未发生。2026-10-01 官方价格页显示
deepseek-v4-pro仍在售(版本 DeepSeek-V4-Pro-0813),并发限制 500。
原通知的内容是「计划下线」,最终没有执行。所以 V4 Pro 目前仍可正常调用,定价 ¥4.5/¥13.5(空闲)起,比 V4.1 Flash 贵一倍以上。
给用户的结论:V4.1 Flash 全面超越 V4 Pro(官方基准 + 第三方实测一致),且价格只有 V4 Pro 的一半不到——没有理由再用 V4 Pro,除非有依赖它独有能力的老代码。
对用户主力组合的影响(2026-10-01 更新)
- 价格已不是劣势:输出 ¥4(空闲)/ ¥8(高峰),此前记的「对比 GLM-5.3 Flash 约 ¥3.6 略贵」是 09-10 的旧对比。现在 V4.1 Flash 的缓存命中输入 ¥0.02、并发 2500、输出上限 384K 都是硬优势,长前缀 Agent 任务成本极低
- 真正的差异点:原生多模态(省掉 OCR 绕路)、输出上限 384K(GLM 128K)、并发 2500、缓存命中输入 ¥0.02
- ⚠️ 成本控制提醒(第三方实测证实):V4.1 Flash 爱开多 Agent,复杂任务会自行拉起大量子 Agent,14 个任务实测花费比旧 V4 高 36%。大批量任务建议明确限制它不要自行开多 Agent
- 长上下文仍需人工核对:写长报告时会出现前后数字矛盾(如首页 15.1%、图表 17.8%),关键数字要自己复核
- 主力组合现状(2026-10-01):
deepseek-flash(已配置生效) + MiniMax M3 包月不限量 + GLM-5.3 Flash
用户的实测情况(2026-09-10)
- 用户已在用灰度测试版(即
deepseek-v4.1-flash-expires-on-0910)——先于正式发布上手 - 正式发布时间:2026-09-10 中午 12:00(灰度代号里的
expires-on-0910即到期转正之日) - ✅ 已正式切换并完成配置:用户已把模型名改为
deepseek-flash并配置完成,DeepSeek V4.1 Flash 进入主力模型阵容 - 已解决的历史疑点(2026-10-01):价格口径冲突、高峰时段钟点、V4 Pro 下线状态三处均已核实定论,不再存疑
第三方实测(2026-09-09/10 发布,两家独立评测)
夕小瑶科技说(虎嗅转载):14 组任务、累计 3 亿 token、deepseek harness 环境
明显变好的
- 原生多模态是最大进步:同图解释任务,V4.1 约 5.7 秒完成,旧 V4 用了 200 秒;另一组 7.6 秒 vs 751 秒。原因是旧 Flash 要绕 OCR + 像素分析,V4.1 直接看图
- 视觉推理:给三张参考图做游戏,V4.1 正确保留角色配色与关卡位置关系;V4 把 5×5 理解成 7×7、角色也做错
- 前端可视化:孪生素数星系图,两边算出的 58980 对完全一致,但 V4.1 的螺旋星系能正常显示、可定位;V4 中央画布全黑
- 速度:开测初期约 284 token/s vs 旧 V4 约 97 token/s(近 3 倍),但后半程差距收窄
没变好 / 反而更差的
- 交付不一定更快:《星光邮局》V4.1 用了 34.5 分钟 vs 旧 V4 的 30.5 分钟——生成代码更快(15.5 min vs 23.4 min),但等工具运行的时间更长(18.7 min vs 6.6 min),把省下的时间花在自检验证上
- 长上下文待进步:写 10 万字网文,V4.1 节奏拖沓(同一扫地动作来回写);同一份报告里首页写年化 15.1%、图表标 17.8%,数字自相矛盾
- 花费可能更高:14 个任务 V4.1 花 ¥61.96 vs 旧 V4 ¥45.47(多 36%)——因为它爱开多 Agent,游戏+小说两题累计开了 37 个子 Agent、仅子任务就超 1 亿 token
- 也有更省的任务:飞机建模 897 万 vs 1849 万 token;《星光邮局》805 万 vs 1461 万(省 45%)
作者结论(5 条):视觉理解进步明显;复杂任务易开多 Agent 导致 token 消耗多;数分与报告工程和 V4 几乎没区别;非视觉端到端任务完成时间无明显变化;长上下文理解仍有进步空间。
网易智能:3 个可运行应用(3D 停车游戏 / 小店 / 预约系统)
- 代码生成速度:V4.1 三题分别 4:47、1:41、2:15,均为旧 V4 的 3-4 成用时(V4 分别 11:27、5:54、6:45)
- 正确率:V4.1 三套应用全部通过检查;旧 V4 游戏画面上下颠倒(相机上方向算反)、小店重启后订单查询返回空
- Token:预约系统一题输出少 14.4%、总 token 少 44.7%;三题合计输出少 14.4%、总 token 少 44.7%(但 V4 成品未完整,口径不完全可比)
- 花费参考:V4.1 ¥5.55 vs V4 ¥5.41(基本持平,跨峰谷时段)
两家交叉验证的共识
| 维度 | 结论 | 来源 |
|---|---|---|
| 原生多模态 / 视觉理解 | 大幅进步 | 两家一致 |
| 代码生成速度 | 显著变快(3-4 成用时) | 两家一致 |
| 代码正确率 | 提升(网易:旧 V4 两题有 bug) | 网易 |
| 长上下文一致性 | 仍弱(数字/细节前后矛盾) | 虎嗅 |
| token 成本 | 取决于任务:轻任务更省、重任务因多 Agent 更贵(多 36%) | 虎嗅;网易基本持平 |
| 端到端交付时间 | 非视觉任务无明显改善 | 虎嗅 |
使用提示:避免让它在大任务上自行开多 Agent(虎嗅实测多 Agent 是成本超支主因);长文档/长报告任务注意核对前后数字一致性。
相关笔记
- DeepSeek - 公司与 V4 家族总览
- DeepSeek V4 Flash - 上代经济版(本模型的替代对象之一)
- GLM-5.3 - 当前质量敏感活主力(潜在被替代者)
- MiniMax - M3 包月(量活位)
相关日记
- 2026-09-09 - 发布官宣日,记录对主力模型组合的影响
- 2026-09-10 - 正式发布日,记录官方价格与口径冲突
- 2026-10-01 - 核实定论:价格冲突解开(以调价通知为准)、高峰时段钟点确认(周一至周五 9-12/14-18)、V4 Pro 下线未发生仍在售;补记成本控制提醒(爱开多 Agent 导致超支)