AutomationBench
基本信息
- 出品方:Zapier 发布的开放基准,2026-04-20 博客发布
- 配套论文:arXiv:2604.18934(Daniel Shepard、Robin Salimans,2026-04-21 提交,CC BY-4.0)
- 测什么:AI 能否完成真实业务工作流——跨应用的 REST API 编排,覆盖销售、营销、运营、客服、财务、HR 六大领域
- 规模:47 个模拟应用、约 500 个 API 端点、600+ 保留评测任务,公私集分离
- 可用工具:仅
search(BM25)与execute两个,单任务上限 50 步 - 评分方式:程序化、只看终态,不使用 LLM-as-judge。指标
task_completed_correctly要求全部断言通过,5/6 拿 0.83 部分分但不算完成
2026-10-02 榜单(重要更正)
原笔记「GLM-5.3-Flash 得分 48.8,超过 Claude Opus 4.8」是错的。
| 名次 | 模型 | 分数 |
|---|---|---|
| 1 | GPT 6 Astra (Max) | 41.4% |
- Claude Opus 4.8 未进前十
- 论文(2026-04)摘要写「最强前沿模型目前低于 10%」,四个月后榜一已升到 41.4%,论文结论已过期
一个值得注意的发现
官方 FAQ 指出最大失败模式是虚假自信:Opus 72%、Gemini 91%、GPT-5.4 84% 的失败案例中,模型都宣称自己完成了任务,实际世界状态是错的。这条与 misalignment(行为错位) 高度相关。
官方链接
- 发布公告:https://zapier.com/blog/introducing-automationbench/
- 榜单:https://zapier.com/benchmarks
- GitHub:https://github.com/zapier/AutomationBench
相关笔记
- DeepSWE - 编程向 Agent 基准
- GLM-5.3 · GPT-6.1 Astra · misalignment(行为错位)
相关日记
- 2026-09-23 - GLM-5.3-Flash 三方对比引用(该分数已更正)