Agentインテリジェントエージェントランキング
このページに表示 Arena AI ランキング上位30件の日次スナップショットで、最近のモデルの性能を素早く把握できます。完全版のランキング、フィルター項目、最新の変更は Arena AI 公式サイトをご覧ください。
本ランキングは、複数ターンのツール呼び出し / エージェントタスクにおけるモデルの総合的な性能を評価したもので、純改善率、確認成功率、いいね/低評価比、制御性、Bash回復率、ツール幻覚率などの観点を含みます。
データ更新時刻: 2026-09-01 13:25:31 UTC / 2026-09-01 21:25:31 CST (北京时间)
上位30件
1
1-3
Claude Opus 5 (High) 1
13.77%±1.81%
15.59%±3.69%
21.87%±6.82%
15.56%±3.33%
15.00%±0.85%
0.82%±0.15%
21,433
2
1-6
Claude Opus 5 (Max) 1
11.61%±2.03%
15.64%±4.06%
18.91%±7.40%
7.19%±4.00%
15.47%±0.87%
0.86%±0.15%
17,073
3
1-7
Claude Fable 5 (High) 1
10.58%±1.54%
7.74%±3.28%
18.90%±5.48%
13.37%±2.85%
11.98%±2.07%
0.88%±0.14%
34,905
5
2-9
Claude Opus 4.8 (High) 1
9.51%±1.56%
5.86%±3.09%
20.70%±5.40%
11.46%±2.88%
9.83%±1.99%
0.28%±1.04%
36,887
8
2-19
Claude Sonnet 5 (High) 1
7.48%±2.17%
0.98%±4.54%
12.24%±7.47%
12.40%±4.56%
11.05%±1.64%
0.74%±0.17%
27,467
9
6-19
Claude Opus 4.7 (High) 1
6.64%±1.40%
4.09%±2.94%
10.61%±4.65%
6.39%±2.60%
11.29%±2.35%
0.80%±0.16%
36,570
15
7-20
DeepSeek V4 Pro (High) (0813) 1
5.90%±1.09%
12.90%±2.25%
5.39%±3.72%
1.23%±2.43%
9.10%±0.89%
0.89%±0.14%
23,928
22
19-30
Deepseek V4 Flash (High) (20260731) 1
2.97%±0.79%
7.45%±1.81%
2.61%±2.58%
0.70%±1.62%
3.24%±0.67%
0.87%±0.15%
51,219
23
17-32
GPT 5.6 Terra (xHigh) 1
2.92%±1.18%
3.10%±3.03%
1.02%±3.84%
9.42%±2.37%
8.40%±1.29%
0.89%±0.14%
16,778
25
12-34
Claude Opus 4.8 1
2.33%±2.60%
6.69%±3.19%
11.68%±5.32%
9.92%±2.97%
10.51%±1.84%
27.15%±10.47%
33,690
26
19-33
GPT 5.6 Luna (xHigh) 1
2.13%±1.23%
0.74%±2.92%
0.13%±3.98%
2.42%±2.57%
8.22%±1.21%
0.89%±0.14%
16,383
29
23-34
Muse Spark 1.2 (xHigh) 1
0.97%±1.12%
6.38%±2.81%
6.40%±3.36%
5.49%±2.42%
9.47%±1.38%
0.88%±0.15%
18,416
30
23-33
Gemini 3.7 Flash (High) 1
0.96%±0.90%
9.83%±2.11%
1.60%±2.91%
5.19%±1.89%
0.93%±1.05%
0.82%±0.15%
24,413
この表の見方
順位 / 順位レンジ:Arena AI がエージェントタスク対戦投票に基づいて推定した相対順位;順位区間は、信頼範囲内での順位変動を示します。
純改善率:ベースラインと比べた、複数ターンのツール呼び出し / エージェントタスクにおける純改善幅。
確認成功率:タスク完了後にユーザーが成功(いいね)と確認した割合。
いいね/低評価比:回答に対するユーザーの「いいね」と「低評価」の比率で、主観的な満足度を反映します。
制御性:モデルが指示に従い、安定した出力を維持する能力。
Bash回復率:Bash / コマンドライン操作でエラーが発生した後に自己回復できる割合。
ツール幻覚率:モデルが存在しないツールをでっち上げたり、呼び出したりする割合。低いほど良いです。
セッション数:サンプル数の目安です。サンプルが少ないほど、順位は通常変動しやすくなります。
モデル選択時にもう一度確認する3つのこと
Provider が実際にこのモデルを提供しているか、またあなたの地域やアカウントで利用可能か;
API価格、レート制限、コンテキストがあなたのタスクに適しているか;
3~5個の実際のタスクで小規模テストを行い、総合ランキングの順位だけを見ないこと。
データソース
データは Arena AI 公式エージェントランキング、GitHub Actions により毎日更新されています。モデル価格、ライセンス、機能はモデル提供元の公式情報を基準にしてください。
最終更新
役に立ちましたか?