For the complete documentation index, see llms.txt. This page is also available as Markdown.

代码 / Web 开发榜单

本页展示 Arena AI 榜单前 30 名的每日快照,方便快速了解近期模型表现。完整榜单、筛选项和最新变化请到 Arena AI 官网查看。

本榜单评测模型在 Web 前端开发(HTML/CSS/JS)任务上的实际表现。

数据更新时间: 2026-09-09 12:41:37 UTC / 2026-09-09 20:41:37 CST (北京时间)

排行榜反映特定评测和用户投票偏好,不等同于模型在你的任务中一定更好。选择模型时还要考虑价格、速度、上下文、工具调用、隐私和地区可用性。

前 30 名

排名
排名区间
模型
分数
票数
价格 $/百万Token
上下文

1

1-2

gpt-6-astra-max 1

1796 (++19/-19)

1,810

$10/$50

1.1M

2

1-2

claude-fable-5.1-max 1

1764 (++15/-15)

2,570

$10/$50

1M

3

3-6

claude-opus-5-max 1

1688 (++8/-8)

11,396

$5/$25

1M

4

3-6

qwen3.8-max-0902 1

1685 (++16/-16) Preliminary

1,973

$2/$6

N/A

5

3-8

kimi-k3-max 1

1674 (++11/-11)

4,546

$3/$15

1M

6

3-8

qwen3.8-max 1

1670 (++12/-12) Preliminary

3,218

$2/$6

1M

7

5-8

claude-opus-5-high 1

1661 (++7/-7)

11,497

$5/$25

1M

8

5-13

muse-spark-1.3-max 1

1650 (++18/-18)

1,344

$1.25/$4.25

1M

9

8-16

qwen3.8-flash-next 1

1631 (++14/-14) Preliminary

2,377

$0.16/$0.47

1M

10

8-15

claude-fable-5 1

1628 (++8/-8)

9,595

$10/$50

1M

11

8-16

muse-spark-1.3 (xHigh) 1

1625 (++17/-17)

1,545

$1.25/$4.25

1M

12

8-16

grok-4.6-high 1

1624 (++11/-11)

3,727

$2/$6

500K

13

8-16

hy4-preview 1

1623 (++15/-15) Preliminary

1,838

$0.83/$2.50

1M

14

9-16

gpt-5.6-sol-xhigh (codex-harness) 1

1617 (++7/-7)

11,344

$4/$20

1.1M

15

9-17

glm-5.3-max 1

1613 (++12/-12)

3,213

$1.40/$4.40

1M

16

10-20

glm-5.3-flash 1

1605 (++14/-14)

2,259

$0.07/$0.25

1M

17

15-21

qwen3.8-27b 1

1591 (++10/-10)

3,906

$0.40/$3

N/A

18

16-21

glm-5.2-max 1

1589 (++7/-7)

10,087

$1.40/$4.40

1M

19

16-22

gemini-3.7-flash-high 1

1587 (++12/-12) Preliminary

3,003

$0.75/$3.75

1M

20

16-22

deepseek-v4-flash-high 1

1582 (++10/-10)

4,410

$0.44/$1.32

1M

21

17-22

deepseek-v4-pro-high-20260813 1

1580 (++11/-11)

3,759

$1.32/$3.96

N/A

22

19-26

gemini-3.8-flash-high 1

1568 (++12/-12) Preliminary

2,722

$0.75/$3.75

1M

23

22-26

claude-opus-4-8-high 1

1561 (++7/-7)

13,250

$5/$25

1M

24

22-27

claude-opus-4-7 1

1557 (++6/-6)

15,907

$5/$25

1M

25

22-29

grok-4.5 1

1556 (++8/-8)

7,629

$2/$6

500K

26

22-28

claude-opus-4-7-high 1

1555 (++6/-6)

16,379

$5/$25

1M

27

24-33

claude-opus-4-6-high 1

1546 (++6/-6)

18,329

$5/$25

1M

28

25-33

muse-spark-1.1 1

1541 (++8/-8)

7,543

$1.25/$4.25

N/A

29

27-33

claude-opus-4-8 1

1540 (++7/-7)

12,119

$5/$25

1M

30

27-33

claude-sonnet-5-high 1

1538 (++7/-7)

8,717

$2/$10

1M

怎么看这张表

  • 排名 / 排名区间:Arena AI 根据对战投票估算的相对名次;排名区间表示在置信范围内的名次波动。

  • 分数:相对评分,适合比较同一时刻榜单中的模型。

  • 票数 / 会话数:样本量参考;样本较少时,排名通常更容易波动。

  • 价格 $/百万Token:输入 / 输出每百万 Token 的参考价格。

  • 上下文:模型支持的最大上下文长度。

选模型时再确认三件事

  1. Provider 是否实际提供这个模型,以及你的地区和账户是否可用;

  2. API 价格、速率限制和上下文是否适合你的任务;

  3. 用 3~5 个真实任务做小规模测试,不要只看总榜名次。

数据来源

数据来自 Arena AI 官方 代码 / Web 开发榜单,由 GitHub Actions 每天更新。模型价格、许可证和能力请以模型服务商官方信息为准。

最后更新于

这有帮助吗?