最后更新于
这有帮助吗?
模型榜单用于辅助比较不同模型的相对表现,不应单独作为选型结论。数据来自 Arena AI,由 GitHub Actions 每日自动更新。
选择模型时还应综合考虑任务类型、上下文长度、多模态与工具调用能力、速度、价格、地区可用性和数据政策。排行榜与价格会动态变化,请以页面标注的更新时间和模型服务商官方信息为准。
Agent 智能体榜单:本榜单评测模型在多轮工具调用 / 智能体任务上的综合表现,涵盖净改进率、确认成功率、赞踩比、可控性、Bash 恢复率、工具幻觉率等维度。
文本榜单:本榜单是 Arena AI 最核心的文本对战榜单,根据人类盲投对战估算模型相对实力。
搜索榜单:本榜单评测模型在联网搜索 / 信息检索类任务上的表现。
视觉榜单:本榜单评测多模态模型在图像理解类任务上的表现。
代码 / Web 开发榜单:本榜单评测模型在 Web 前端开发(HTML/CSS/JS)任务上的实际表现。
文生图榜单:本榜单评测文生图模型根据文本提示生成图像的能力。
如果您在配置或使用过程中遇到任何疑问、Bug 或有功能改进建议,请参考 反馈与建议 中提供的官方渠道。
最后更新于
这有帮助吗?
这有帮助吗?