AI竞技场排行榜 在线对比Chat/图片/视频模型
在线覆盖12个竞技场,通过Elo评分对比聊天、图片和视频生成模型,数据来自公开竞技场的真人盲测投票,附投票数和置信区间,适合模型选型参考等场景。
更新于 2026-09-11
相关工具
功能特性
- 12 个竞技场排行榜:对话、智能体、网页开发、图生网页、文生图、图像编辑、文生视频、图生视频、视频编辑、视觉理解、文档理解、搜索
- Elo 盲测评分:真人匿名对比两个模型后投票,沿用原 Chatbot Arena(LMArena)的方法论
- 对话榜 385 个模型:最大规模文本竞技场,含 Elo、投票数与置信区间
- 智能体榜五大信号:任务完成率、好评率、可操控性、终端恢复、工具幻觉率,各自带置信区间
- 价格列:每 1M token 输入输出单价,权衡质量与成本
- 投票数列:投票越多评分越可靠
- 每个评分带置信区间:显示分数随数据增加可能变动的范围
- 上下文窗口列:128K、1M 及更大窗口直接对比
- 快照日期:页面顶部标注数据新鲜度
使用方法
- 1打开页面默认显示对话榜:最大的竞技场,当前 Elo 领先者排在表格最前
- 2切换 tab 换竞技场:智能体、网页开发、文生图、文生视频、视觉理解、文档、搜索等
- 3看 Elo 列:分差 100 意味着高分模型约 64% 胜率
- 4看投票数列:投票很少的模型评分可能随新投票大幅波动
- 5看置信区间:区间越宽说明评分还在变动
- 6用价格列权衡质量与成本:每美元最好的未必是排名最高的
- 7智能体榜看五大信号:任务完成、好评、可操控、终端恢复、工具幻觉(幻觉率越低越好)
- 8把前 3-5 名当短名单,在自己任务上实测后再决定
常见问题
Elo 评分是什么?和跑分基准有什么区别?
Elo 源自国际象棋:模型两两盲测对比,赢家加分输家扣分,分差 100 意味着高分模型约 64% 胜率。与跑分基准(测试集正确率)不同,Elo 反映真实用户在开放任务上的偏好:回答的是「哪个用起来更好」,不是「哪个测试分更高」。
这个和 Chatbot Arena(LMArena)是同一个吗?
是:数据来自 arena.ai,即原 Chatbot Arena / LMArena(IM-bench)更名后的平台。盲测方法和公开数据同源,本页把它整理成 12 个独立竞技场。
数据多久更新一次?
投票持续收集,快照定期刷新:页面顶部始终显示快照日期,引用排名前先确认。
为什么我常用的模型不在榜里?
模型只有获得足够投票才会被排名。新发布或流量低的模型可能还没有公开 Elo。另外快照日期之前发布的模型也不在本期数据中。
置信区间(±)是什么意思?
± 范围是 Elo 评分的统计不确定度。区间越宽说明随投票增加分数可能变动越大。两个模型区间重叠时基本可视为并列。
投票数说明什么?
投票数是该模型参与两两对比的次数。投票越多评分通常越可靠;投票很少(几百以内)的模型可能随新投票大幅变动。
智能体榜的五大信号怎么读?
任务完成率:智能体任务正确完成的比例;好评率:用户反馈的正面程度;可操控性:模型遵循指令的程度;终端恢复:从终端错误中恢复的能力;工具幻觉率:编造或错误调用工具的比例,越低越好。每个信号都带置信区间。
为什么网页开发榜和对话榜分开?
网页开发评测的是另一种能力:把提示词(或截图,见图生网页榜)变成可用的网页。聊天好的模型不一定擅长做网页,所以分开排名。
图像和视频榜与「AI 视频图像音乐排行榜」工具重复吗?
不重复。那个工具用的是另一评测机构的基准 Elo,本页用的是 arena.ai 真人盲测投票数据:衡量真实用户偏好而非任务得分。两者的结论可能不同:模型可能在客观测试中排名高,但用户偏好排名低。
能直接按这个排名做生产选型吗?
当短名单可以,当结论不行。Elo 反映通用提示词下的人群偏好,你的具体场景可能更适合排名靠后的模型。选前 3-5 个,在自己的任务上实测,再结合成本决策。
竞技场排行榜上有哪些开源模型?
开源权重模型与闭源模型同台竞技:DeepSeek、Llama、Qwen、Mistral、Gemma 与 OpenAI、Anthropic 的模型出现在同一榜单。竞技场不按许可证拆分排名,要对比开源模型之间的表现,按模型系列筛选,观察它们的相对名次和置信区间即可。
排行榜的数据从哪来的?
Elo 评分、投票数与价格来自 arena.ai(原 Chatbot Arena / LMArena)的公开竞技场快照:真人盲测偏好投票平台。我们抓取其公开榜单并清洗数据;快照日期在页面顶部。
现在最强的 AI 模型是哪个?
看哪个竞技场。当前对话榜第一是 Claude Fable 5(约 1509 Elo),Claude Opus 4.6/4.7 Thinking 和 Qwen3.8 Max 紧随其后;智能体榜第一是 Claude Opus 5 (High);网页开发榜第一是 Claude Opus 5 (max)。「最强」因任务而异:按你要做的事选对应竞技场。
为什么这个排行榜里没有专门的编程(coding)竞技场?
本页使用的 arena.ai 快照共发布 12 个竞技场:对话、智能体、网页开发、图像、视频、视觉、文档、搜索,其中没有单独的编程榜。智能体榜是最接近编程的信号(它衡量工具调用与终端恢复能力),对话榜覆盖通用推理。需要编程专项排名时,可以看 SWE-bench 这类基准榜单,或从本页选几个模型用自己的提示词实测。