AutomationBench

基本信息

  • 出品方:Zapier 发布的开放基准,2026-04-20 博客发布
  • 配套论文:arXiv:2604.18934(Daniel Shepard、Robin Salimans,2026-04-21 提交,CC BY-4.0)
  • 测什么:AI 能否完成真实业务工作流——跨应用的 REST API 编排,覆盖销售、营销、运营、客服、财务、HR 六大领域
  • 规模:47 个模拟应用、约 500 个 API 端点、600+ 保留评测任务,公私集分离
  • 可用工具:仅 search(BM25)与 execute 两个,单任务上限 50 步
  • 评分方式:程序化、只看终态,不使用 LLM-as-judge。指标 task_completed_correctly 要求全部断言通过,5/6 拿 0.83 部分分但不算完成

2026-10-02 榜单(重要更正)

原笔记「GLM-5.3-Flash 得分 48.8,超过 Claude Opus 4.8」是错的。

名次模型分数
1GPT 6 Astra (Max)41.4%
  • Claude Opus 4.8 未进前十
  • 论文(2026-04)摘要写「最强前沿模型目前低于 10%」,四个月后榜一已升到 41.4%,论文结论已过期

一个值得注意的发现

官方 FAQ 指出最大失败模式是虚假自信:Opus 72%、Gemini 91%、GPT-5.4 84% 的失败案例中,模型都宣称自己完成了任务,实际世界状态是错的。这条与 misalignment(行为错位) 高度相关。

官方链接

相关笔记

相关日记

  • 2026-09-23 - GLM-5.3-Flash 三方对比引用(该分数已更正)