Step-5(Preview)
基本信息
- 出品方:阶跃星辰(StepFun,上海,正冲刺港股 IPO)
- 发布:2026-09-20,API 即日开放;开源权重 2026-10-15 放出
- 定位:新一代开源旗舰基座模型,主打 Agentic 任务、AI 编程、专业知识工作、金融
规格
- 600B 总参数 / 27B 激活,稀疏 MoE 架构;上下文 1M tokens;支持文本 + 图片 + 视频输入
- 延续阶跃三代的「效率」路线:用不到 Kimi K3 五分之一的体量拿到同分
成绩(2026-10-02 核实后修正)
- Step Code Bench 49.0(high)——对比:Claude Opus 5 max 74.0、GLM-5.3 max 40.2、Kimi K3 max 43.9
- Frontier Finance 金融测试超过 GLM-5.3 / Kimi K3 / DeepSeek V4.1 Flash;AIME 24 60%
- ⚠️ 原笔记写「AA 综合智能指数 44 分、仅次于 Qwen3.8 Max(45)」有误:Qwen3.8 这一代官方不存在(见 Qwen),同期旗舰应为 Qwen3.5-Plus 一档
- ⚠️ 原笔记写「DeepSWE v1.1 编程测试 67.7%」查无实据:当前 DeepSWE v1.1 榜无 Step-5 条目(见 DeepSWE)。上面的 Step Code Bench 是阶跃自家榜单,两个口径不能混用
价格(官方牌价,按 1M tokens)
step-5-preview:输入 ¥7(缓存命中 ¥0.35)/ 输出 ¥20;推理过程的思维链 token 也按输出价计费,agent 场景要留意
- 同家参考:step-3.7-flash ¥1.35 / ¥0.27 / ¥8.1;step-3.5-flash ¥0.7 / ¥0.14 / ¥2.1
单任务成本对比(AA 口径加权平均)
| 模型 | 单任务成本 |
|---|
| Claude Opus 5 | ≈ $5.7(官方宣称 Step 5 仅为其 1/8) |
| Kimi K3 | ≈ $2 |
| Step 5 Preview | ≈ $0.71 |
| DeepSeek V4.1 Flash(用户主力) | ≈ $0.27 |
判断(对用户)
- 不算贵,但看跟谁比:同档国际旗舰里是便宜的;比 DeepSeek V4.1 Flash 贵约 2.6 倍 → 日常轻任务没有换的理由
- 它的主场:编程 agent 长任务、金融类长文档分析——供应链盈利模型若涉及此类材料可以一试
- 10-15 开源后可零成本试用再定;专家评价「教科书式达标交卷,离代际跃迁还差一步」,纯价格优势会随行业成本下降被抹平
- 结论:留在备选清单,不替换现有配置
- ⚠️ 未证实项:2026-10-02 抓取时官网首页仍显示「开源发布倒计时」未完成,无法确认 10-15 是否已按计划开源
官方链接
相关日记