For the complete documentation index, see llms.txt. This page is also available as Markdown.

搜尋榜單

本頁展示 Arena AI 呢個榜單係前 30 名嘅每日快照,方便快速了解近期模型表現。完整榜單、篩選項同最新變化請到 Arena AI 官網查看。

呢個榜單評測模型喺連網搜尋 / 資訊檢索類任務上嘅表現。

數據更新時間: 2026-09-01 13:25:31 UTC / 2026-09-01 21:25:31 CST (北京時間)

排行榜反映特定評測同用戶投票偏好,唔代表模型喺你嘅任務入面一定更好。揀模型時仲要考慮價格、速度、上下文、工具調用、私隱同地區可用性。

前 30 名

排名
排名區間
模型
分數
票數
價格 $/百萬Token
上下文

1

1-2

gpt-5.6-sol-xhigh 1

1257 (±7)

29,663

$4 / $20

1.1M

2

1-2

claude-opus-4-6-search 1

1253 (±5)

134,699

$5 / $25

1M

3

3-5

gpt-5.5-search 1

1242 (±5)

89,873

$5 / $30

1.1M

4

3-6

claude-opus-4-7 1

1233 (±5)

91,394

$5 / $25

1M

5

3-7

claude-fable-5 1

1230 (±8)

41,795

$10 / $50

1M

6

4-8

ernie-5.1 1

1227 (±10)

3,788

N/A

N/A

7

5-8

claude-sonnet-4-6-search 1

1221 (±5)

134,905

$1.50 / $7.50

1M

8

6-13

grok-4.5 1

1213 (±7)

31,505

$2 / $6

500K

9

8-13

gemini-3.1-pro-grounding 1

1210 (±5)

113,282

N/A

N/A

10

8-16

gemini-3-pro-grounding 1

1207 (±6)

37,024

$2 / $12

N/A

11

8-16

gpt-5.2-search 1

1207 (±6)

52,712

$0.88 / $7

400K

12

8-17

claude-opus-4-8 1

1204 (±6)

70,998

$5 / $25

1M

13

8-17

grok-4.20-multi-agent-beta-0309 1

1204 (±5)

109,553

$1.25 / $2.50

1M

14

10-18

gpt-5.1-search 1

1199 (±5)

59,909

$0.63 / $5

400K

15

10-18

gemini-3-flash-grounding 1

1198 (±5)

149,334

N/A

N/A

16

10-18

gpt-5.4-search 1

1197 (±5)

110,116

$2.50 / $15

1.1M

17

12-18

claude-sonnet-5-search 1

1194 (±7)

40,230

$2 / $10

1M

18

14-19

grok-4.20-beta1 1

1189 (±6)

53,921

N/A

N/A

19

18-22

claude-opus-4-5-search 1

1180 (±6)

61,573

$5 / $25

200K

20

19-23

gpt-5.2-search-non-reasoning 1

1172 (±6)

75,658

$0.88 / $7

400K

21

19-23

grok-4-1-fast-search 1

1171 (±5)

81,507

$1.25 / $2.50

2M

22

19-23

grok-4-fast-search 1

1171 (±5)

41,794

$0.20 / $0.50

2M

23

20-24

grok-4.3 1

1165 (±5)

91,483

$1.25 / $2.50

1M

24

23-24

claude-sonnet-4-5-search 1

1158 (±5)

127,378

$1.50 / $7.50

1M

25

25-29

claude-opus-4-1-search 1

1148 (±5)

76,933

$15 / $75

200K

26

25-29

o3-search 1

1144 (±5)

20,644

$1 / $4

200K

27

25-30

gemini-2.5-pro-grounding 1

1142 (±5)

83,404

$0.63 / $5

1M

28

25-31

grok-4-search 1

1142 (±6)

19,108

$3 / $15

N/A

29

25-31

ppl-sonar-reasoning-pro-high 1

1139 (±6)

29,055

$1 / $1

127.1K

30

27-32

gpt-5-search 1

1133 (±6)

20,781

$0.63 / $5

400K

點睇呢張表

  • 排名 / 排名區間:Arena AI 根據對戰投票估算嘅相對名次;排名區間表示喺置信範圍內嘅名次波動。

  • 分數:相對評分,適合同一時間榜單入面嘅模型比較。

  • 票數 / 會話數:樣本量參考;樣本較少時,排名通常更容易波動。

  • 價格 $/百萬Token:輸入 / 輸出每百萬 Token 嘅參考價格。

  • 上下文:模型支援嘅最大上下文長度。

揀模型時再確認三樣嘢

  1. 供應商係咪真係有提供呢個模型,以及你所在地區同帳戶係咪可用;

  2. API 價格、速率限制同上下文係咪適合你嘅任務;

  3. 用 3~5 個真實任務做小規模測試,唔好淨係睇總榜名次。

數據來源

數據嚟自 Arena AI 官方 搜尋榜單,由 GitHub Actions 每日更新。模型價格、許可證同能力請以模型服務商官方資訊為準。

最後更新

呢個有冇幫助?