Agent 智能体榜单
本页展示 Arena AI 榜单前 30 名的每日快照,方便快速了解近期模型表现。完整榜单、筛选项和最新变化请到 Arena AI 官网查看。
本榜单评测模型在多轮工具调用 / 智能体任务上的综合表现,涵盖净改进率、确认成功率、赞踩比、可控性、Bash 恢复率、工具幻觉率等维度。
数据更新时间: 2026-09-01 13:25:31 UTC / 2026-09-01 21:25:31 CST (北京时间)
前 30 名
1
1-3
Claude Opus 5 (High) 1
13.77%±1.81%
15.59%±3.69%
21.87%±6.82%
15.56%±3.33%
15.00%±0.85%
0.82%±0.15%
21,433
2
1-6
Claude Opus 5 (Max) 1
11.61%±2.03%
15.64%±4.06%
18.91%±7.40%
7.19%±4.00%
15.47%±0.87%
0.86%±0.15%
17,073
3
1-7
Claude Fable 5 (High) 1
10.58%±1.54%
7.74%±3.28%
18.90%±5.48%
13.37%±2.85%
11.98%±2.07%
0.88%±0.14%
34,905
5
2-9
Claude Opus 4.8 (High) 1
9.51%±1.56%
5.86%±3.09%
20.70%±5.40%
11.46%±2.88%
9.83%±1.99%
0.28%±1.04%
36,887
8
2-19
Claude Sonnet 5 (High) 1
7.48%±2.17%
0.98%±4.54%
12.24%±7.47%
12.40%±4.56%
11.05%±1.64%
0.74%±0.17%
27,467
9
6-19
Claude Opus 4.7 (High) 1
6.64%±1.40%
4.09%±2.94%
10.61%±4.65%
6.39%±2.60%
11.29%±2.35%
0.80%±0.16%
36,570
15
7-20
DeepSeek V4 Pro (High) (0813) 1
5.90%±1.09%
12.90%±2.25%
5.39%±3.72%
1.23%±2.43%
9.10%±0.89%
0.89%±0.14%
23,928
22
19-30
Deepseek V4 Flash (High) (20260731) 1
2.97%±0.79%
7.45%±1.81%
2.61%±2.58%
0.70%±1.62%
3.24%±0.67%
0.87%±0.15%
51,219
23
17-32
GPT 5.6 Terra (xHigh) 1
2.92%±1.18%
3.10%±3.03%
1.02%±3.84%
9.42%±2.37%
8.40%±1.29%
0.89%±0.14%
16,778
25
12-34
Claude Opus 4.8 1
2.33%±2.60%
6.69%±3.19%
11.68%±5.32%
9.92%±2.97%
10.51%±1.84%
27.15%±10.47%
33,690
26
19-33
GPT 5.6 Luna (xHigh) 1
2.13%±1.23%
0.74%±2.92%
0.13%±3.98%
2.42%±2.57%
8.22%±1.21%
0.89%±0.14%
16,383
29
23-34
Muse Spark 1.2 (xHigh) 1
0.97%±1.12%
6.38%±2.81%
6.40%±3.36%
5.49%±2.42%
9.47%±1.38%
0.88%±0.15%
18,416
30
23-33
Gemini 3.7 Flash (High) 1
0.96%±0.90%
9.83%±2.11%
1.60%±2.91%
5.19%±1.89%
0.93%±1.05%
0.82%±0.15%
24,413
怎么看这张表
排名 / 排名区间:Arena AI 根据智能体任务对战投票估算的相对名次;排名区间表示在置信范围内的名次波动。
净改进率:相比基线在多轮工具调用 / 智能体任务中的净改进幅度。
确认成功率:任务完成后用户确认成功(赞)的比例。
赞踩比:用户对回答投“赞”与“踩”的比例,反映主观满意度。
可控性:模型遵循指令并保持稳定输出的能力。
Bash 恢复率:在 Bash / 命令行操作出错后能自我恢复的比例。
工具幻觉率:模型虚构或调用不存在工具的比例,越低越好。
会话数:样本量参考;样本较少时,排名通常更容易波动。
选模型时再确认三件事
Provider 是否实际提供这个模型,以及你的地区和账户是否可用;
API 价格、速率限制和上下文是否适合你的任务;
用 3~5 个真实任务做小规模测试,不要只看总榜名次。
数据来源
数据来自 Arena AI 官方 Agent 智能体榜单,由 GitHub Actions 每天更新。模型价格、许可证和能力请以模型服务商官方信息为准。
最后更新于
这有帮助吗?