For the complete documentation index, see llms.txt. This page is also available as Markdown.

搜索榜单

本页展示 Arena AI 榜单前 30 名的每日快照,方便快速了解近期模型表现。完整榜单、筛选项和最新变化请到 Arena AI 官网查看。

本榜单评测模型在联网搜索 / 信息检索类任务上的表现。

数据更新时间: 2026-09-01 13:25:31 UTC / 2026-09-01 21:25:31 CST (北京时间)

排行榜反映特定评测和用户投票偏好,不等同于模型在你的任务中一定更好。选择模型时还要考虑价格、速度、上下文、工具调用、隐私和地区可用性。

前 30 名

排名
排名区间
模型
分数
票数
价格 $/百万Token
上下文

1

1-2

gpt-5.6-sol-xhigh 1

1257 (±7)

29,663

$4 / $20

1.1M

2

1-2

claude-opus-4-6-search 1

1253 (±5)

134,699

$5 / $25

1M

3

3-5

gpt-5.5-search 1

1242 (±5)

89,873

$5 / $30

1.1M

4

3-6

claude-opus-4-7 1

1233 (±5)

91,394

$5 / $25

1M

5

3-7

claude-fable-5 1

1230 (±8)

41,795

$10 / $50

1M

6

4-8

ernie-5.1 1

1227 (±10)

3,788

N/A

N/A

7

5-8

claude-sonnet-4-6-search 1

1221 (±5)

134,905

$1.50 / $7.50

1M

8

6-13

grok-4.5 1

1213 (±7)

31,505

$2 / $6

500K

9

8-13

gemini-3.1-pro-grounding 1

1210 (±5)

113,282

N/A

N/A

10

8-16

gemini-3-pro-grounding 1

1207 (±6)

37,024

$2 / $12

N/A

11

8-16

gpt-5.2-search 1

1207 (±6)

52,712

$0.88 / $7

400K

12

8-17

claude-opus-4-8 1

1204 (±6)

70,998

$5 / $25

1M

13

8-17

grok-4.20-multi-agent-beta-0309 1

1204 (±5)

109,553

$1.25 / $2.50

1M

14

10-18

gpt-5.1-search 1

1199 (±5)

59,909

$0.63 / $5

400K

15

10-18

gemini-3-flash-grounding 1

1198 (±5)

149,334

N/A

N/A

16

10-18

gpt-5.4-search 1

1197 (±5)

110,116

$2.50 / $15

1.1M

17

12-18

claude-sonnet-5-search 1

1194 (±7)

40,230

$2 / $10

1M

18

14-19

grok-4.20-beta1 1

1189 (±6)

53,921

N/A

N/A

19

18-22

claude-opus-4-5-search 1

1180 (±6)

61,573

$5 / $25

200K

20

19-23

gpt-5.2-search-non-reasoning 1

1172 (±6)

75,658

$0.88 / $7

400K

21

19-23

grok-4-1-fast-search 1

1171 (±5)

81,507

$1.25 / $2.50

2M

22

19-23

grok-4-fast-search 1

1171 (±5)

41,794

$0.20 / $0.50

2M

23

20-24

grok-4.3 1

1165 (±5)

91,483

$1.25 / $2.50

1M

24

23-24

claude-sonnet-4-5-search 1

1158 (±5)

127,378

$1.50 / $7.50

1M

25

25-29

claude-opus-4-1-search 1

1148 (±5)

76,933

$15 / $75

200K

26

25-29

o3-search 1

1144 (±5)

20,644

$1 / $4

200K

27

25-30

gemini-2.5-pro-grounding 1

1142 (±5)

83,404

$0.63 / $5

1M

28

25-31

grok-4-search 1

1142 (±6)

19,108

$3 / $15

N/A

29

25-31

ppl-sonar-reasoning-pro-high 1

1139 (±6)

29,055

$1 / $1

127.1K

30

27-32

gpt-5-search 1

1133 (±6)

20,781

$0.63 / $5

400K

怎么看这张表

  • 排名 / 排名区间:Arena AI 根据对战投票估算的相对名次;排名区间表示在置信范围内的名次波动。

  • 分数:相对评分,适合比较同一时刻榜单中的模型。

  • 票数 / 会话数:样本量参考;样本较少时,排名通常更容易波动。

  • 价格 $/百万Token:输入 / 输出每百万 Token 的参考价格。

  • 上下文:模型支持的最大上下文长度。

选模型时再确认三件事

  1. Provider 是否实际提供这个模型,以及你的地区和账户是否可用;

  2. API 价格、速率限制和上下文是否适合你的任务;

  3. 用 3~5 个真实任务做小规模测试,不要只看总榜名次。

数据来源

数据来自 Arena AI 官方 搜索榜单,由 GitHub Actions 每天更新。模型价格、许可证和能力请以模型服务商官方信息为准。

最后更新于

这有帮助吗?