官方介绍

Arena(原名 LMArena,更早叫 Chatbot Arena)是一个让大模型「匿名打擂台、靠真人投票分高下」的评测平台,起源于伯克利校园项目、由 LMSYS 组织运作,2026 年完成 1.5 亿美元融资、估值 17 亿美元,被称为 AI 领域最公正、最权威的全球大模型性能榜单之一,排名被各家厂商广泛引用。Agent Arena 是平台底下的一个榜单,专门评测模型作为智能体(Agent)时能否真正完成任务。

核心功能

机制说明
匿名对战两个身份未知的模型各答一次,用户盲投选更好的,避免品牌偏见
Elo 评分源自国际象棋的 Elo 算法把数百万次投票汇成动态排行榜,难以刷题
多个榜单Text Arena(聊天问答)、Code Arena 含 WebDev(写代码)、Agent Arena(智能体完成任务)
Agent 五信号任务完成确认 / 好评率 / 纠错响应 / 报错恢复 / 工具幻觉
$/任务指标按「完成一次任务」的成本计价(而非按 token),配合 Pareto 前沿视图展示每个价位的性能上限

使用说明

  1. 访问官网查看总榜与分榜(Text / Code / Agent),榜单数据持续累积更新
  2. Agent Arena 评的是用户在 Agent Mode 里交给模型的完整任务(185 万次会话、46+ 个模型),当前第一为 Claude Fable 5.1 (Max)
  3. 选型建议:看分类型榜单 + 看 $/任务,比只看总榜第一名更有参考价值;价格差距可达 45 倍以上
提醒:Arena 是众包偏好评价,衡量的是人的满意度而非事实准确率;排名高不等于划算,应结合预算在 Pareto 线上选型。

官方链接