For the complete documentation index, see llms.txt. This page is also available as Markdown.

Agent 智能體榜單

本頁顯示 Arena AI 前 30 名榜單嘅每日快照,方便快速了解近期模型表現。完整榜單、篩選項同最新變化請去 Arena AI 官網睇。

呢個榜單評測模型喺多輪工具調用/智能體任務上嘅綜合表現,涵蓋淨改善率、確認成功率、讚踩比、可控性、Bash 恢復率、工具幻覺率等維度。

數據更新時間: 2026-09-01 13:25:31 UTC / 2026-09-01 21:25:31 CST (北京时间)

排行榜反映特定評測同用戶投票偏好,唔等同於模型喺你嘅任務入面一定更好。揀模型時仲要考慮價格、速度、上下文、工具調用、私隱同地區可用性。

前 30 名

排名
排名區間
模型
淨改善率
確認成功率
讚踩比
可控性
Bash 恢復率
工具幻覺率
會話數

1

1-3

Claude Opus 5 (High) 1

13.77%±1.81%

15.59%±3.69%

21.87%±6.82%

15.56%±3.33%

15.00%±0.85%

0.82%±0.15%

21,433

2

1-6

Claude Opus 5 (Max) 1

11.61%±2.03%

15.64%±4.06%

18.91%±7.40%

7.19%±4.00%

15.47%±0.87%

0.86%±0.15%

17,073

3

1-7

Claude Fable 5 (High) 1

10.58%±1.54%

7.74%±3.28%

18.90%±5.48%

13.37%±2.85%

11.98%±2.07%

0.88%±0.14%

34,905

4

2-8

GPT 5.6 Sol (xHigh) 1

9.76%±1.53%

7.89%±3.19%

22.82%±5.69%

8.38%±2.88%

8.82%±1.03%

0.89%±0.14%

28,524

5

2-9

Claude Opus 4.8 (High) 1

9.51%±1.56%

5.86%±3.09%

20.70%±5.40%

11.46%±2.88%

9.83%±1.99%

0.28%±1.04%

36,887

6

3-8

Kimi K3 (Max) 1

8.74%±0.66%

16.89%±1.34%

16.20%±2.30%

1.85%±1.29%

7.86%±0.53%

0.89%±0.14%

94,549

7

4-16

GPT 5.5 (xHigh) 1

7.89%±1.07%

2.61%±2.34%

13.34%±3.78%

8.74%±1.98%

13.88%±1.19%

0.88%±0.14%

50,040

8

2-19

Claude Sonnet 5 (High) 1

7.48%±2.17%

0.98%±4.54%

12.24%±7.47%

12.40%±4.56%

11.05%±1.64%

0.74%±0.17%

27,467

9

6-19

Claude Opus 4.7 (High) 1

6.64%±1.40%

4.09%±2.94%

10.61%±4.65%

6.39%±2.60%

11.29%±2.35%

0.80%±0.16%

36,570

10

7-20

Claude Opus 4.7 1

6.33%±1.42%

3.65%±3.05%

10.63%±4.65%

7.86%±2.61%

8.66%±2.49%

0.83%±0.15%

37,121

11

7-19

GPT 5.5 (High) 1

6.10%±1.00%

1.68%±2.13%

10.65%±3.46%

5.87%±1.80%

11.40%±1.53%

0.89%±0.14%

73,880

12

7-19

GLM 5.2 (Max) 1

6.08%±0.78%

8.49%±1.68%

10.59%±2.71%

5.45%±1.43%

4.99%±0.81%

0.89%±0.14%

65,079

13

7-20

Grok 4.5 1

6.06%±1.15%

6.01%±2.55%

5.63%±4.09%

7.20%±2.24%

10.57%±1.17%

0.89%±0.14%

34,008

14

7-20

Qwen3.8 Max 1

6.01%±1.13%

10.76%±2.43%

6.80%±3.91%

5.40%±2.25%

7.18%±1.00%

0.11%±0.27%

18,386

15

7-20

DeepSeek V4 Pro (High) (0813) 1

5.90%±1.09%

12.90%±2.25%

5.39%±3.72%

1.23%±2.43%

9.10%±0.89%

0.89%±0.14%

23,928

16

7-21

Grok 4.6 (xHigh) 1

5.76%±1.29%

11.89%±2.95%

2.52%±4.44%

3.80%±2.74%

9.70%±0.90%

0.89%±0.14%

15,090

17

8-24

Claude Opus 4.6 1

5.22%±1.34%

3.13%±2.96%

7.52%±4.49%

5.24%±2.48%

9.31%±1.84%

0.88%±0.14%

36,365

18

8-24

GPT 5.5 1

4.84%±0.88%

2.11%±1.95%

6.32%±2.97%

4.76%±1.61%

10.13%±1.17%

0.89%±0.14%

77,762

19

8-27

GLM 5.3 Flash 1

4.41%±1.37%

15.21%±2.85%

5.21%±4.56%

1.89%±2.96%

1.15%±1.28%

0.89%±0.14%

9,970

20

16-27

GLM 5.3 (Max) 1

3.82%±0.80%

12.60%±1.78%

4.23%±2.62%

0.73%±1.60%

0.65%±0.85%

0.89%±0.14%

41,022

21

17-29

GPT 5.4 (High) 1

3.25%±0.86%

2.52%±2.04%

0.11%±2.83%

4.37%±1.72%

8.57%±0.94%

0.89%±0.14%

76,973

22

19-30

Deepseek V4 Flash (High) (20260731) 1

2.97%±0.79%

7.45%±1.81%

2.61%±2.58%

0.70%±1.62%

3.24%±0.67%

0.87%±0.15%

51,219

23

17-32

GPT 5.6 Terra (xHigh) 1

2.92%±1.18%

3.10%±3.03%

1.02%±3.84%

9.42%±2.37%

8.40%±1.29%

0.89%±0.14%

16,778

24

17-33

Qwen3.8 Flash Next 1

2.44%±1.88%

12.34%±3.72%

1.59%±6.40%

1.06%±4.39%

2.92%±1.03%

0.41%±0.35%

8,777

25

12-34

Claude Opus 4.8 1

2.33%±2.60%

6.69%±3.19%

11.68%±5.32%

9.92%±2.97%

10.51%±1.84%

27.15%±10.47%

33,690

26

19-33

GPT 5.6 Luna (xHigh) 1

2.13%±1.23%

0.74%±2.92%

0.13%±3.98%

2.42%±2.57%

8.22%±1.21%

0.89%±0.14%

16,383

27

21-33

Qwen 3.8 27B 1

1.50%±1.17%

7.24%±2.67%

1.39%±3.90%

0.20%±2.39%

1.49%±1.05%

0.16%±0.25%

16,060

28

19-37

Kimi K2.7 Code 1

1.38%±2.48%

2.15%±5.45%

1.19%±8.44%

5.26%±5.45%

2.56%±2.76%

0.89%±0.14%

11,142

29

23-34

Muse Spark 1.2 (xHigh) 1

0.97%±1.12%

6.38%±2.81%

6.40%±3.36%

5.49%±2.42%

9.47%±1.38%

0.88%±0.15%

18,416

30

23-33

Gemini 3.7 Flash (High) 1

0.96%±0.90%

9.83%±2.11%

1.60%±2.91%

5.19%±1.89%

0.93%±1.05%

0.82%±0.15%

24,413

點樣睇呢張表

  • 排名 / 排名區間:Arena AI 根據智能體任務對戰投票估算嘅相對名次;排名區間表示喺置信範圍內嘅名次波動。

  • 淨改善率:相比基線喺多輪工具調用/智能體任務中嘅淨改善幅度。

  • 確認成功率:任務完成後用戶確認成功(讚)嘅比例。

  • 讚踩比:用戶對回答投「讚」同「踩」嘅比例,反映主觀滿意度。

  • 可控性:模型遵循指令並保持穩定輸出嘅能力。

  • Bash 恢復率:喺 Bash/命令列操作出錯後能自我恢復嘅比例。

  • 工具幻覺率:模型虛構或調用不存在工具嘅比例,越低越好。

  • 會話數:樣本量參考;樣本較少時,排名通常更容易波動。

揀模型時再確認三件事

  1. Provider 係咪真係有提供呢個模型,以及你嘅地區同帳戶係咪可用;

  2. API 價格、速率限制同上下文係咪適合你嘅任務;

  3. 用 3~5 個真實任務做小規模測試,唔好只睇總榜名次。

數據來源

數據嚟自 Arena AI 官方 Agent 智能體榜單,由 GitHub Actions 每日更新。模型價格、授權同能力請以模型供應商官方資訊為準。

最後更新

呢個有冇幫助?