Agent 智能體榜單
本頁顯示 Arena AI 前 30 名榜單嘅每日快照,方便快速了解近期模型表現。完整榜單、篩選項同最新變化請去 Arena AI 官網睇。
呢個榜單評測模型喺多輪工具調用/智能體任務上嘅綜合表現,涵蓋淨改善率、確認成功率、讚踩比、可控性、Bash 恢復率、工具幻覺率等維度。
數據更新時間: 2026-09-01 13:25:31 UTC / 2026-09-01 21:25:31 CST (北京时间)
前 30 名
1
1-3
Claude Opus 5 (High) 1
13.77%±1.81%
15.59%±3.69%
21.87%±6.82%
15.56%±3.33%
15.00%±0.85%
0.82%±0.15%
21,433
2
1-6
Claude Opus 5 (Max) 1
11.61%±2.03%
15.64%±4.06%
18.91%±7.40%
7.19%±4.00%
15.47%±0.87%
0.86%±0.15%
17,073
3
1-7
Claude Fable 5 (High) 1
10.58%±1.54%
7.74%±3.28%
18.90%±5.48%
13.37%±2.85%
11.98%±2.07%
0.88%±0.14%
34,905
5
2-9
Claude Opus 4.8 (High) 1
9.51%±1.56%
5.86%±3.09%
20.70%±5.40%
11.46%±2.88%
9.83%±1.99%
0.28%±1.04%
36,887
8
2-19
Claude Sonnet 5 (High) 1
7.48%±2.17%
0.98%±4.54%
12.24%±7.47%
12.40%±4.56%
11.05%±1.64%
0.74%±0.17%
27,467
9
6-19
Claude Opus 4.7 (High) 1
6.64%±1.40%
4.09%±2.94%
10.61%±4.65%
6.39%±2.60%
11.29%±2.35%
0.80%±0.16%
36,570
15
7-20
DeepSeek V4 Pro (High) (0813) 1
5.90%±1.09%
12.90%±2.25%
5.39%±3.72%
1.23%±2.43%
9.10%±0.89%
0.89%±0.14%
23,928
22
19-30
Deepseek V4 Flash (High) (20260731) 1
2.97%±0.79%
7.45%±1.81%
2.61%±2.58%
0.70%±1.62%
3.24%±0.67%
0.87%±0.15%
51,219
23
17-32
GPT 5.6 Terra (xHigh) 1
2.92%±1.18%
3.10%±3.03%
1.02%±3.84%
9.42%±2.37%
8.40%±1.29%
0.89%±0.14%
16,778
25
12-34
Claude Opus 4.8 1
2.33%±2.60%
6.69%±3.19%
11.68%±5.32%
9.92%±2.97%
10.51%±1.84%
27.15%±10.47%
33,690
26
19-33
GPT 5.6 Luna (xHigh) 1
2.13%±1.23%
0.74%±2.92%
0.13%±3.98%
2.42%±2.57%
8.22%±1.21%
0.89%±0.14%
16,383
29
23-34
Muse Spark 1.2 (xHigh) 1
0.97%±1.12%
6.38%±2.81%
6.40%±3.36%
5.49%±2.42%
9.47%±1.38%
0.88%±0.15%
18,416
30
23-33
Gemini 3.7 Flash (High) 1
0.96%±0.90%
9.83%±2.11%
1.60%±2.91%
5.19%±1.89%
0.93%±1.05%
0.82%±0.15%
24,413
點樣睇呢張表
排名 / 排名區間:Arena AI 根據智能體任務對戰投票估算嘅相對名次;排名區間表示喺置信範圍內嘅名次波動。
淨改善率:相比基線喺多輪工具調用/智能體任務中嘅淨改善幅度。
確認成功率:任務完成後用戶確認成功(讚)嘅比例。
讚踩比:用戶對回答投「讚」同「踩」嘅比例,反映主觀滿意度。
可控性:模型遵循指令並保持穩定輸出嘅能力。
Bash 恢復率:喺 Bash/命令列操作出錯後能自我恢復嘅比例。
工具幻覺率:模型虛構或調用不存在工具嘅比例,越低越好。
會話數:樣本量參考;樣本較少時,排名通常更容易波動。
揀模型時再確認三件事
Provider 係咪真係有提供呢個模型,以及你嘅地區同帳戶係咪可用;
API 價格、速率限制同上下文係咪適合你嘅任務;
用 3~5 個真實任務做小規模測試,唔好只睇總榜名次。
數據來源
數據嚟自 Arena AI 官方 Agent 智能體榜單,由 GitHub Actions 每日更新。模型價格、授權同能力請以模型供應商官方資訊為準。
最後更新
呢個有冇幫助?