モデルランキング
モデルランキングは、異なるモデルの相対的な性能を比較する補助として用いるもので、単独でモデル選定の結論とすべきではありません。データは Arena AIで、GitHub Actions により毎日自動更新されています。
モデルを選ぶ際には、タスクの種類、コンテキスト長、マルチモーダル対応とツール呼び出し能力、速度、価格、地域ごとの利用可否、データポリシーも総合的に考慮してください。ランキングと価格は動的に変化するため、ページに記載された更新時刻と各モデル提供元の公式情報を基準にしてください。
ランキング目録
Agent エージェントランキング:本ランキングは、多輪のツール呼び出し/エージェントタスクにおけるモデルの総合的な性能を評価し、純改善率、確認成功率、賛否比、制御性、Bash復旧率、ツール幻覚率などの指標を含みます。
テキストランキング:本ランキングは Arena AI の中核となるテキスト対戦ランキングであり、人間のブラインド投票による対戦結果からモデルの相対的な実力を推定します。
検索ランキング:本ランキングは、オンライン検索/情報検索系タスクにおけるモデルの性能を評価します。
ビジュアルランキング:本ランキングは、画像理解系タスクにおけるマルチモーダルモデルの性能を評価します。
コード/Web開発ランキング:本ランキングは、Webフロントエンド開発(HTML/CSS/JS)タスクにおけるモデルの実際の性能を評価します。
画像生成ランキング:本ランキングは、テキストプロンプトに基づいて画像を生成する画像生成モデルの能力を評価します。
💡 ヘルプの取得とフィードバックの送信
設定や使用中にご不明点、バグ、または機能改善のご提案がありましたら、 フィードバックと提案 に記載された公式チャネルをご参照ください。
最終更新
役に立ちましたか?