ARC-AGI-3
是什么
- ARC-AGI-3:ARC Prize 基金会(François Chollet 发起)推出的第三代 AGI 评测基准,正式发布于 2026-03-25(此前有 2025 年预览期)
- 与前两代(ARC-AGI-1/2 的抽象图形谜题)不同,ARC-AGI-3 改为交互式游戏:模型要在陌生环境里自己探索规则、规划行动,考察快速适应全新问题的「流体智力」
- 纯靠训练数据「背题」行不通,信息必须在交互中才能拿到
- 官网:https://arcprize.org
2026-09-29 刷分现状(重要更正)
「目前较难被刷分」这个说法已过时。 最新实测:
| 模型 | 分数 | 时间 |
|---|---|---|
| GPT-6.1 Sol | 96.37% | 2026-09-29 |
| GPT-6 Astra(Provider Adapter 口径) | 99.95% | — |
| GPT-6 Astra(Standard 口径) | 62.71% | — |
- 两种口径差距高达 37 个百分点,不是造假,是 harness 不同:官方把 Standard 与 Provider Adapter 两列分数并排展示,前者统一环境、后者允许模型自带工具链
- Standard 口径最高分花费约 18,817
- ARC Prize 2026 奖金池 200 万美元;首个里程碑奖 3.75 万美元(2026-06-30 截止,冠军 Tufa Labs 的 “The Duck”),第二个里程碑奖 2026-09-30 已截止
相关笔记
- GPT-6.1 Astra · GPT-6 Sol - 在此基准上刷分的模型
- AGI - 该基准试图衡量的目标
- DeepSWE - 另一编程向 Agent 基准
相关日记
- 2026-09-04 - GPT-6 发布讨论时建档