大模型排行榜2026 在线对比LLM智商与速度
对比261个LLM模型的智能、编程、速度和成本,数据来自公开基准测试,支持按参数档位筛选,适合模型选型和API选择参考。
更新于 2026-09-11
相关工具
功能特性
- 七维排行榜:智能、编程、智能体、最低成本、最快、响应快、知识
- 参数大小分层:旗舰/中型/轻量/微型四档,同体量模型才有可比性
- 真实基准分数:公开基准聚合快照,非厂商宣传值
- 每任务成本列:完成一个标准评测任务的平均美元成本,反映真实使用开销
- 价格列:每 1M token 混合价(3:1 输入输出比例)与缓存价
- 上下文窗口列:128K、1M 及更大窗口直接对比
- 开源权重标记:开锁图标标注可自部署的模型
- 推理模型标记:大脑图标标注先思考再回答的模型
- est. 估算标记:估算分(推断而非实测)明确标注
使用方法
- 1打开页面默认显示旗舰档智能榜:分数最高的模型排在前面
- 2切换参数大小(旗舰/中型/轻量/微型):不同体量的模型不可比,请在同一档内对比
- 3切换 tab 换维度:编程、智能体、最低成本、最快、响应快、知识各自独立排名
- 4最低成本 tab 按每任务成本升序:完成一个标准评测任务最省钱的模型在前
- 5最快 tab 按输出速度(tok/s)降序:高吞吐场景参考
- 6响应快 tab 按端到端响应时间升序:聊天与交互应用参考
- 7知识 tab 使用准确率减幻觉惩罚的分数,可为负值:负分越深说明幻觉越严重
- 8分数条按当前列表归一化:最高分满条,相对水平一眼可见
- 9悬停 est. 标记确认分数为估算:估算分可靠性低于实测分
常见问题
这些跑分数据准吗?
分数是公开基准聚合的定期快照,是相对参考而非官方结论。用于比较模型档次是可靠的,但相邻模型 2 分以内的差距属于噪声。建议先用榜单缩小范围,再在自己的任务上验证候选模型。
为什么我的模型不在排行榜里?
本快照收录 261 个模型。模型缺失有两种情况:源数据中没有它的基准分,或源数据未标注它的参数大小(多为预览版和已下架模型)。你仍可在 AI 模型数据库查到它,只是这里没有分数。
最低成本 tab 按什么算的?
按每任务成本:模型完成一个标准评测任务的平均美元开销(含输入、输出与推理 token)。越低越好,免费模型成本为零所以排最前。这是数据源自己的指标,不是我们计算的。
速度和响应快是一回事吗?
不是。速度是输出吞吐(tok/s),衡量生成快慢;响应快是端到端响应时间,还包含首 token 时间,受服务商基础设施影响。按你的使用场景选对应指标。
推理模型看起来慢是正常的吗?
正常。推理模型回答前先消耗 token 思考,原始 tok/s 低于非推理模型。这是设计使然:请在同为推理模型的范围内比较,不要和非推理模型比。
排行榜多久更新一次?
数据源发布新一轮基准后刷新,大约每月一次。页面顶部始终显示快照日期:引用任何排名前先确认日期。
哪个模型编程最强?
编程 tab 按编程指数排名:当前旗舰档第一是 GPT-5.6 Sol (xhigh)(78.3),领先 Claude Opus 5。要看 Claude Code、Codex 这类编程工具,请用 AI 编程工具排行榜。
这个工具和 AI 模型数据库有什么区别?
数据库用于查规格、比价格:300+ 模型搜索筛选、并排对比;本排行榜回答「现在谁最强」:先按基准分排名,表格里附规格信息。
为什么免费模型在最低成本榜排最前?
该 tab 按每任务成本排序,免费模型成本为零自然在最前。同一参数档内免费选项就是最省钱的选择,需要权衡的是它的分数是否够用。
能直接按这个排名做生产选型吗?
建议当短名单用,不要当结论。基准聚合覆盖大量任务,你的场景可能更适合排名靠后的模型。选前 3-5 个在代表性样本上实测,按结果决策。
怎么解读模型在总榜中的排名?
总榜排名是各评测维度(知识、编程、数学、指令跟随)的平均。总榜第10的模型可能在编程维度排第2:选模型前一定要看分维度排名。排名也会随快照更新而变化,所以要在同一个快照日期内对比模型,而不是跨日期比较。
开源(开放权重)模型怎么找?
开放权重的模型名字旁有开锁图标,可以自部署。当前快照中包括 DeepSeek V4 Flash、GLM-5.2、Nemotron 3 Ultra 等。本页不单独做开源排名,而是在每个维度内用图标标注。
现在最便宜的 AI 模型 API 是哪个?
按每任务成本(当前旗舰档):Command A+ 免费、MiMo-V2.5 约 $0.01、DeepSeek V4 Flash 约 $0.03。旗舰档之外,轻量和微型档更便宜。价格列显示每 1M token 单价:每 token 最便宜和每任务最便宜是两个问题。
最快的大模型是哪个?
最快 tab 按实测输出速度排名:当前旗舰档第一是 Step 3.7 Flash(约 364 tok/s),其后是 Muse Spark 1.1 和 Gemini 3.6 Flash。推理模型因先生成思考 token,原始 tok/s 更低。
排行榜的数据和价格从哪来的?
分数和价格都来自 Artificial Analysis(独立第三方评测机构)的公开榜单快照,我们抓取并清洗后打包为静态数据;页面顶部显示快照日期。分数是相对参考,不是厂商官方结果。