For the complete documentation index, see llms.txt. This page is also available as Markdown.

模型榜单

模型榜单用于辅助比较不同模型的相对表现,不应单独作为选型结论。数据来自 Arena AI,由 GitHub Actions 每日自动更新。

选择模型时还应综合考虑任务类型、上下文长度、多模态与工具调用能力、速度、价格、地区可用性和数据政策。排行榜与价格会动态变化,请以页面标注的更新时间和模型服务商官方信息为准。

榜单目录

  • Agent 智能体榜单:本榜单评测模型在多轮工具调用 / 智能体任务上的综合表现,涵盖净改进率、确认成功率、赞踩比、可控性、Bash 恢复率、工具幻觉率等维度。

  • 文本榜单:本榜单是 Arena AI 最核心的文本对战榜单,根据人类盲投对战估算模型相对实力。

  • 搜索榜单:本榜单评测模型在联网搜索 / 信息检索类任务上的表现。

  • 视觉榜单:本榜单评测多模态模型在图像理解类任务上的表现。

  • 代码 / Web 开发榜单:本榜单评测模型在 Web 前端开发(HTML/CSS/JS)任务上的实际表现。

  • 文生图榜单:本榜单评测文生图模型根据文本提示生成图像的能力。


💡 获取帮助与提交反馈

如果您在配置或使用过程中遇到任何疑问、Bug 或有功能改进建议,请参考 反馈与建议 中提供的官方渠道。

最后更新于

这有帮助吗?