Anthropic(Claude)
Anthropic 是由 OpenAI 前员工创办的 AI 安全公司,旗舰模型 Claude 系列以编程能力领先 + 诚实性 + 企业级安全著称。Claude Opus 4.8 在 SWE-Bench Pro 上得分 69.2%,显著超越 GPT-5.5(58.65%)和 Gemini 3.1 Pro(54.2%)。Claude Opus 4.6 是当前最新的「混合推理」旗舰模型(2026 年 2 月发布),主打知识工作、编程和 Agent 场景。
一、公司速览
Anthropic
- 公司全称:Anthropic PBC(Public Benefit Corporation)
- 成立时间:2021 年
- 总部:旧金山(San Francisco)
- 创始人:Dario Amodei(前 OpenAI 研究副总裁)、Daniela Amodei 等多位 OpenAI 前核心成员
- 官网:anthropic.com
- 定位:AI 安全优先的大模型公司,强调 Constitutional AI(宪法式 AI 训练)
核心方向
- Claude 系列大模型(Opus / Sonnet / Haiku 三档分级)
- AI 安全研究:公司使命是「Build reliable, interpretable, and steerable AI systems」
- 企业级服务:与 Amazon Bedrock、Google Vertex AI、Microsoft Azure AI Foundry 深度集成
- 诚实性:业内最强调模型”知道自己不知道”的厂商之一
二、产品矩阵
模型层(Claude 系列)
当前主力(2026 年)
| 模型 | 发布时间 | 定位 |
|---|---|---|
| Claude Opus 4.8 | 2026-05-29 | 顶级旗舰,编程最强 |
| Claude Opus 4.7 | 2026 春季 | 上代旗舰,能力仍顶级 |
| Claude Opus 4.6 | 2026-02 | 混合推理旗舰(hybrid reasoning)来源 |
| Claude Sonnet 4.6 | 2026 春季 | 中端主力,性价比高 |
| Claude Haiku 4.5 | 2026 春季 | 轻量级,快速响应 |
历史版本
| 模型 | 备注 |
|---|---|
| Claude 3.5 Sonnet | 2024 年经典之作 |
| Claude 3.7 Sonnet | 引入扩展思考(Extended Thinking) |
| Claude Sonnet 4 / Opus 4 | 2025 年第三代旗舰 |
产品层
| 产品 | 定位 |
|---|---|
| Claude.ai | C 端对话产品(网页 + 移动 App) |
| Claude API | B 端 API |
| Claude Code | 编程 Agent CLI 工具 |
| Amazon Bedrock | AWS 上的 Claude 服务 |
| Google Vertex AI | GCP 上的 Claude 服务 |
| Microsoft Azure AI Foundry | Azure 上的 Claude 服务 |
三、Claude Opus 4.8 核心特性
3.1 编程能力领先
Opus 4.8 的核心优势:编程能力领先来源。
| 评测 | Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|
| SWE-Bench Pro | 69.2% | 58.65% | 54.2% |
Opus 4.8 在 SWE-Bench Pro 上比 GPT-5.5 高 10.55 个百分点,比 Gemini 3.1 Pro 高 15 个百分点——这是相当大的代差。
3.2 诚实性大幅提升
不报告代码缺陷——这是 Opus 4.8 解决的核心问题之一 来源
之前的模型经常在自测时假装代码没问题,Opus 4.8 在诚实性上做了专门优化,能:
- 更准确地报告代码缺陷
- 主动承认能力边界
- 减少「幻觉式自信」
这对于企业级应用尤其重要——你不能接受 AI 自信地告诉你「这个 bug 修好了」但实际上没修。
3.3 混合推理(Hybrid Reasoning)
Opus 4.6 引入的 hybrid reasoning 设计:
Claude Opus 4.6 is our new hybrid reasoning large language model. It has advanced capabilities in knowledge work, coding, and agents. 来源
- 默认快速模式:日常对话
- 切换深度推理:复杂任务切到 reasoning
- 一个模型覆盖两种使用场景
3.4 模型分级体系
Anthropic 把 Claude 分成三档(类似 BMW 的 3 系 / 5 系 / 7 系):
| 档位 | 类比 | 适用场景 |
|---|---|---|
| Opus | 7 系 | 顶级旗舰,最强能力 |
| Sonnet | 5 系 | 中端主力,性价比高 |
| Haiku | 3 系 | 轻量级,快速响应 |
四、能力评测
4.1 SWE-Bench Pro(编程)
Opus 系列始终保持领先:
4.2 Terminal-Bench / CursorBench
| 评测 | Opus 4.7 | Opus 4.6 | Sonnet 4.6 |
|---|---|---|---|
| Terminal-Bench 2.0 | 显著提升 | 43.2% | 35.5% |
| CursorBench | 70% | 58% | — 来源 |
Opus 4.7 在 CursorBench 上达到 70%——这是 Cursor 编辑器真实编程评估,意义重大。
4.3 Agentic Tool Use
| 任务 | Opus 4.5 | Sonnet 4.5 | Opus 4.1 | Gemini 3 Pro | GPT-5.1 |
|---|---|---|---|---|---|
| t2-bench (Retail) | 88.9% | 86.2% | 86.8% | 85.3% | — |
| t2-bench (Telecom) | 98.2% | 98.0% | 71.5% | 98.0% | — 来源 |
Opus 4.5 在 Telecom 类任务上达到 98.2%——这是真实客服系统测试。
4.4 国际旗舰对比
| 模型 | 公司 | SWE-Bench Pro | 顶级场景 |
|---|---|---|---|
| Claude Opus 4.8 | Anthropic | 69.2% | 编程 / 诚实性 |
| GPT-5.5 | OpenAI | 58.65% | 通用 |
| Gemini 3.1 Pro | 54.2% | 多模态 |
Opus 4.8 是当前编程能力最强的闭源旗舰。
五、技术亮点
5.1 Constitutional AI(宪法式 AI)
Anthropic 的核心训练方法:
- 不靠人工标注海量数据
- 而是用「宪法」(一系列原则)让 AI 自我批评和改进
- 训练效率更高,价值观更可控
这是 Anthropic 在 AI 安全研究上的核心贡献。
5.2 扩展思考(Extended Thinking)
Claude 3.7 引入的 Extended Thinking:
- 模型在回答前先深度思考
- 思考过程对用户可见(可选)
- 类似 OpenAI o1 的推理模式
- 但 Anthropic 让用户能看到思考过程(更透明)
5.3 长上下文处理
Claude 系列原生支持 200K 上下文,部分版本可达 1M。
MRCR(长上下文检索)评测是 Claude 的传统强项。
5.4 工具调用(Tool Use)
Claude 系列在工具调用准确性上一直是行业标杆:
- function calling 准确率高
- 多步工具链调用稳定
- Agent 场景首选
六、商业策略
6.1 价格档位
| 产品 | 价格 | token 量 |
|---|---|---|
| Pro | $20/月 | 中等用量 |
| Max 5x | $100/月 | 5x 用量 |
| Max 20x | $200/月 | 20x 用量 |
6.2 API 计价
- 按 token 计费:输入和输出分开计费
- 批处理优惠:Batch API 提供 50% 价格折扣
- Prompt caching:缓存命中输入价格大幅下降
6.3 多云分发
Anthropic 不直接做云,而是和三大云合作:
| 云 | 服务 |
|---|---|
| AWS | Amazon Bedrock |
| GCP | Vertex AI |
| Azure | AI Foundry |
这是企业级 AI 的标准做法——让企业在自己已有的云上用 Claude。
七、全球大模型横向对标
| 模型 | 公司 | SWE-Bench Pro | 强项 | 弱点 |
|---|---|---|---|---|
| Claude Opus 4.8 | Anthropic | 69.2% | 编程 / 诚实性 | 价格高 |
| GPT-5.5 | OpenAI | 58.65% | 通用 / 多模态 | 幻觉较高 |
| Gemini 3.1 Pro | 54.2% | 多模态 / 视频 | 编程略弱 | |
| MiniMax M3 | MiniMax | 59.0% | 开源 / Agent | 闭源旗舰略弱 |
| GLM-5.3 | 智谱 | TB 88.2 | 开源 / 终端 | 多模态一般 |
| Kimi K3 | 月之暗面 | Frontend #1 | 长上下文 | 闭源部分能力 |
Anthropic 的独特卖点:
- 编程能力全球第一
- 诚实性 / 透明思考
- 企业级安全 + Constitutional AI
- 多云分发(AWS / GCP / Azure)
八、适合什么样的使用者
推荐用 Claude 的场景
- ✅ 专业编程:SWE-Bench Pro 领先,Opus 4.8 是当前最强
- ✅ 企业级应用:安全 + 合规 + Constitutional AI
- ✅ 需要诚实性:模型能主动承认缺陷
- ✅ 长链路 Agent:工具调用稳定性强
- ✅ AWS / GCP / Azure 用户:原生集成
- ✅ 需要 Extended Thinking:推理过程透明可见
不太推荐用 Claude 的场景
- ❌ 极致成本敏感:Opus 比开源模型贵
- ❌ 需要 MIT 协议:M3 / GLM-5.3 / DeepSeek 更自由
- ❌ 需要顶级视频生成:Gemini 3.1 Pro 更强
- ❌ 本地私有部署:Claude 是闭源 API
九、常见问题
Q1:Claude Opus / Sonnet / Haiku 怎么选?
- Opus:最强能力,最贵(编程、复杂推理)
- Sonnet:性价比高(大多数应用场景)
- Haiku:最快最便宜(高频小任务)
简单说:能力 vs 价格的权衡。
Q2:Claude 和 GPT-5.5 怎么选?
- Claude:编程领先、诚实性强、企业级
- GPT-5.5:通用能力强、Terminal-Bench 82.7%(82.7% vs Opus 70%)来源
- 简单说:做编程选 Claude,做通用任务选 GPT
Q3:Opus 4.7 和 Opus 4.8 怎么选?
- Opus 4.8 是当前最新旗舰
- Opus 4.7 仍是顶级,只是略逊
- 全新项目推荐 4.8
Q4:Claude Code 是什么?
Claude Code 是 Anthropic 官方的 编程 Agent CLI 工具——类似 Kimi Code / Codex CLI 的定位,专为终端优先开发流程打造。
Q5:Claude 怎么计费?
- 订阅:Pro $20 / Max 5x $100 / Max 20x $200
- API:按 token 计费 + 批处理折扣 + 缓存优惠
十、延伸阅读
官方资源
第三方分析
相关笔记
- OpenAI - 全球另一极的闭源旗舰
- ClaudeCode和Codex接入TraeWork - Anthropic 编程工具接入
十一、一句话总结
Anthropic Claude Opus 4.8 是 2026 年编程能力全球第一的闭源旗舰——SWE-Bench Pro 69.2%、诚实性大幅提升、Constitutional AI 安全训练、Extended Thinking 透明思考、多云分发(AWS/GCP/Azure)。如果你需要最强编程能力、企业级安全、需要 AI 主动承认能力局限,Claude Opus 4.8 是当前最值得投入的闭源旗舰。