7 个 AI 模型榜单怎么看:最新排名与用途
AI 模型没有一个万能分数。有人擅长聊天,有人擅长写代码,还有人能操作软件完成长任务。下面这 7 个榜单,正好从不同角度看模型能力。
排名采集于 2026 年 9 月 2 日。榜单更新很快,分数只适合比较同一榜单、同一版本和同一配置。
LMArena 同时维护 Text 和 WebDev 两张榜,所以 7 个来源会看到 8 组排名。Artificial Analysis 还提供中文/多语言分榜,本文放在对应章节说明。
1. Artificial Analysis:综合能力
它把推理、知识、编程、指令遵循和 Agent 等多项测试合成一个 Intelligence Index。适合快速判断模型的综合上限,但不能代表价格、速度或具体业务体验。
当前展示:28 个有效配置(全部)
| 名次 | 模型 | 厂商 | 原榜分数 |
|---|---|---|---|
| #1 | Anthropic | 65.7 | |
| #2 | Anthropic | 64.8 | |
| #3 | Anthropic | 63.1 | |
| #4 | Anthropic | 62.5 | |
| #5 | Anthropic | 62.5 | |
| #6 | Anthropic | 62.1 | |
| #7 | OpenAI | 60.9 | |
| #8 | SpaceXAI | 60.9 | |
| #9 | Kimi | 59.7 | |
| #10 | Z AI | 59.5 | |
| #11 | Alibaba | 57.7 | |
| #12 | Z AI | 57.5 | |
| #13 | Meta | 56.8 | |
| #14 | OpenAI | 56.6 | |
| #15 | 56.0 | ||
| #16 | DeepSeek | 53.2 | |
| #17 | OpenAI | 52.3 | |
| #18 | Alibaba | 52.0 | |
| #19 | MiniMax | 45.4 | |
| #20 | Thinking Machines | 42.3 | |
| #21 | NVIDIA | 38.3 | |
| #22 | 37.4 | ||
| #23 | Meta | 35.1 | |
| #24 | Mistral | 30.4 | |
| #25 | Anthropic | 29.9 | |
| #26 | OpenAI | 24.1 | |
| #27 | NVIDIA | 23.6 | |
| #28 | Cohere | 22.8 |
中文/多语言榜更适合关注中文表现。当前中文前三名为:Claude Opus 4.6 Max、Gemini 3.1 Pro Preview、Gemini 3 Pro Preview High,三者均为 94 分。
查看 Intelligence Index · 查看多语言榜
2. LiveBench:不断换题的客观考试
LiveBench 覆盖数学、推理、编程、数据分析、语言和指令遵循等任务。题目会持续更新,答案按客观规则评分,目的是减少模型背过测试题带来的虚高。
它适合看模型的基础解题能力。当前公开快照包含 23 项任务、7 个类别,发布日期为 2026 年 6 月 25 日。
当前展示:Top 50/51 个配置
| 名次 | 模型 | 厂商 | 原榜分数 |
|---|---|---|---|
| #1 | Anthropic | 83.414 | |
| #2 | Anthropic | 82.971 | |
| #3 | OpenAI | 81.054 | |
| #4 | OpenAI | 80.188 | |
| #5 | Anthropic | 80.085 | |
| #6 | Other | 79.508 | |
| #7 | Moonshot AI | 79.193 | |
| #8 | 78.826 | ||
| #9 | Alibaba | 78.461 | |
| #10 | xAI | 78.042 | |
| #11 | OpenAI | 77.972 | |
| #12 | Meta | 77.955 | |
| #13 | OpenAI | 77.936 | |
| #14 | DeepSeek | 77.436 | |
| #15 | 76.952 | ||
| #16 | DeepSeek | 76.758 | |
| #17 | Anthropic | 76.529 | |
| #18 | Anthropic | 76.224 | |
| #19 | Alibaba | 76.194 | |
| #20 | Z.ai | 76.138 | |
| #21 | Anthropic | 76.040 | |
| #22 | xAI | 75.773 | |
| #23 | Meta | 75.300 | |
| #24 | Alibaba | 75.269 | |
| #25 | 74.638 | ||
| #26 | OpenAI | 74.635 | |
| #27 | Anthropic | 74.520 | |
| #28 | DeepSeek | 74.171 | |
| #29 | OpenAI | 73.975 | |
| #30 | 73.588 | ||
| #31 | OpenAI | 73.559 | |
| #32 | Z.ai | 73.157 | |
| #33 | Alibaba | 73.137 | |
| #34 | Anthropic | 72.990 | |
| #35 | Anthropic | 72.582 | |
| #36 | Other | 71.922 | |
| #37 | Z.ai | 71.591 | |
| #38 | DeepSeek | 71.572 | |
| #39 | Moonshot AI | 70.539 | |
| #40 | OpenAI | 69.576 | |
| #41 | Other | 69.235 | |
| #42 | Alibaba | 68.906 | |
| #43 | Moonshot AI | 68.412 | |
| #44 | xAI | 67.781 | |
| #45 | MiniMax | 67.257 | |
| #46 | OpenAI | 66.374 | |
| #47 | DeepSeek | 65.481 | |
| #48 | NVIDIA | 64.155 | |
| #49 | Alibaba | 64.027 | |
| #50 | 63.937 |
3. LMArena:真人盲选
LMArena 不给模型做标准卷,而是让用户同时看到两个匿名答案,再投票选更好的一个。它更接近真实使用偏好,但结果也会受提问人群、回答风格和投票量影响。
- Text:看聊天、写作、数学、编程等开放问题。
- WebDev:看模型生成网页和前端应用的实际效果。
当前展示:Text Top 50;WebDev 20 个实验室(全部)
| 分榜 | 名次 | 模型 | 厂商 | Arena 分数 |
|---|---|---|---|---|
| Text | #1 | Anthropic | 1508±5 | |
| Text | #2 | Anthropic | 1505±4 | |
| Text | #3 | Anthropic | 1502±4 | |
| Text | #4 | Meta | 1499±10 | |
| Text | #5 | Anthropic | 1498±3 | |
| Text | #6 | Anthropic | 1494±4 | |
| Text | #7 | Anthropic | 1492±5 | |
| Text | #8 | Meta | 1491±5 | |
| Text | #9 | 1491±8Preliminary | ||
| Text | #10 | Moonshot | 1489±5 | |
| Text | #11 | Meta | 1488±6 | |
| Text | #12 | Anthropic | 1488±6 | |
| Text | #13 | 1487±3 | ||
| Text | #14 | 1486±4 | ||
| Text | #15 | OpenAI | 1483±5 | |
| Text | #16 | OpenAI | 1482±4 | |
| Text | #17 | Z.ai | 1482±7 | |
| Text | #18 | Anthropic | 1482±4 | |
| Text | #19 | 1480±5 | ||
| Text | #20 | Alibaba | 1479±6 | |
| Text | #21 | 1479±4 | ||
| Text | #22 | OpenAI | 1477±4 | |
| Text | #23 | OpenAI | 1477±4 | |
| Text | #24 | OpenAI | 1476±4 | |
| Text | #25 | 1475±5 | ||
| Text | #26 | SpaceXAI | 1475±5 | |
| Text | #27 | 1474±4 | ||
| Text | #28 | Alibaba | 1474±10 | |
| Text | #29 | OpenAI | 1474±5 | |
| Text | #30 | Z.ai | 1473±9 | |
| Text | #31 | Anthropic | 1473±4 | |
| Text | #32 | Anthropic | 1473±4 | |
| Text | #33 | Anthropic | 1472±4 | |
| Text | #34 | SpaceXAI | 1472±4 | |
| Text | #35 | Z.ai | 1472±5 | |
| Text | #36 | SpaceXAI | 1470±4 | |
| Text | #37 | SpaceXAI | 1470±5 | |
| Text | #38 | Anthropic | 1469±3 | |
| Text | #39 | Xiaomi | 1468±4 | |
| Text | #40 | Baidu | 1468±5 | |
| Text | #41 | OpenAI | 1466±5 | |
| Text | #42 | Z.ai | 1466±4 | |
| Text | #43 | OpenAI | 1466±4 | |
| Text | #44 | Alibaba | 1466±5 | |
| Text | #45 | SpaceXAI | 1465±3 | |
| Text | #46 | Anthropic | 1462±5 | |
| Text | #47 | SpaceXAI | 1461±10Preliminary | |
| Text | #48 | Moonshot | 1461±5 | |
| Text | #49 | Alibaba | 1460±8 | |
| Text | #50 | DeepSeek | 1459±8 | |
| WebDev | #1 | Alibaba | 1691+19/-19Preliminary | |
| WebDev | #2 | Anthropic | 1687+8/-8 | |
| WebDev | #3 | Moonshot AI | 1674+11/-11 | |
| WebDev | #4 | Other | 1629+17/-17Preliminary | |
| WebDev | #5 | Tencent | 1627+17/-17Preliminary | |
| WebDev | #6 | OpenAI | 1616+7/-7 | |
| WebDev | #7 | Other | 1609+13/-13 | |
| WebDev | #8 | 1587+12/-12Preliminary | ||
| WebDev | #9 | DeepSeek | 1583+11/-11 | |
| WebDev | #10 | Other | 1540+8/-8 | |
| WebDev | #11 | Other | 1522+8/-8 | |
| WebDev | #12 | Other | 1487+7/-7 | |
| WebDev | #13 | Other | 1476+6/-6 | |
| WebDev | #14 | Other | 1408+8/-8 | |
| WebDev | #15 | Other | 1371+17/-17 | |
| WebDev | #16 | Other | 1347+10/-10 | |
| WebDev | #17 | Other | 1265+15/-15 | |
| WebDev | #18 | Other | 1254+20/-20 | |
| WebDev | #19 | IBM | 1192+19/-19 | |
| WebDev | #20 | Inception AI | 1166+25/-25 |
WebDev 第一名 Qwen 3.8 Max 0902 仍标为 Preliminary,样本增加后名次可能变化。Text 前三名的置信区间也高度重叠,不宜把几分差距理解为明显胜负。
4. APEX-Agents:专业人士的长任务
APEX-Agents 测试模型能否像投行分析师、管理顾问和公司律师一样工作。任务需要跨多个应用查资料、做分析、写文件,并持续规划较长流程。
它包含 33 个工作场景、480 项任务。相比普通问答榜,它更能反映 Agent 能否把复杂工作真正做完。
当前展示:默认 Mean Score + Loop 的 28 个配置(全部)
| 名次 | 模型 | 厂商 | Mean Score |
|---|---|---|---|
| #1 | Anthropic | 62.0% ± 3.5% | |
| #2 | Anthropic | 60.6% ± 3.6% | |
| #3 | Anthropic | 60.0% ± 3.5% | |
| #4 | Anthropic | 59.2% ± 3.7% | |
| #5 | Meta | 58.1% ± 3.4% | |
| #6 | xAI | 57.5% ± 3.5% | |
| #7 | OpenAI | 56.7% ± 3.3% | |
| #8 | OpenAI | 56.4% ± 3.4% | |
| #9 | Anthropic | 56.2% ± 3.5% | |
| #10 | OpenAI | 55.5% ± 3.6% | |
| #11 | Kimi | 55.4% ± 3.3% | |
| #12 | OpenAI | 54.3% ± 3.3% | |
| #13 | Zhipu | 52.2% ± 3.5% | |
| #14 | DeepSeek | 51.6% ± 3.4% | |
| #15 | OpenAI | 51.3% ± 3.6% | |
| #16 | Anthropic | 50.1% ± 3.5% | |
| #17 | Anthropic | 48.7% ± 3.5% | |
| #18 | 48.7% ± 3.3% | ||
| #19 | Anthropic | 48.5% ± 3.2% | |
| #20 | OpenAI | 47.8% ± 3.7% | |
| #21 | xAI | 47.1% ± 3.4% | |
| #22 | 46.7% ± 3.4% | ||
| #23 | OpenAI | 44.6% ± 3.4% | |
| #24 | OpenAI | 42.5% ± 3.2% | |
| #25 | Kimi | 41.9% ± 3.0% | |
| #26 | Applied Compute | 40.1% ± 3.2% | |
| #27 | Anthropic | 37.1% ± 3.2% | |
| #28 | Zhipu | 21.2% ± 2.2% |
5. Vals Finance Agent:金融分析办公题
这个榜单专门测试金融分析任务,例如查阅公司资料和 SEC 文件、建立判断并给出有依据的回答。它适合选金融研究助手,不适合用来判断通用聊天或编程能力。
这里列的是当前页面提供的 Finance Agent v1.1 Accuracy,快照更新于 2026 年 6 月 4 日。榜首约 64%,也说明复杂金融研究离“完全可靠”还有距离。
当前展示:Top 50/51 个模型
| 名次 | 模型 | 厂商 | Accuracy |
|---|---|---|---|
| #1 | Anthropic | 64.373% | |
| #2 | Anthropic | 63.331% | |
| #3 | Meta | 60.595% | |
| #4 | DeepSeek | 60.389% | |
| #5 | Anthropic | 60.046% | |
| #6 | OpenAI | 59.963% | |
| #7 | 59.717% | ||
| #8 | Anthropic | 58.810% | |
| #9 | OpenAI | 58.535% | |
| #10 | Z.ai | 57.655% | |
| #11 | OpenAI | 57.152% | |
| #12 | Moonshot AI | 57.056% | |
| #13 | OpenAI | 55.309% | |
| #14 | 55.154% | ||
| #15 | Alibaba | 54.627% | |
| #16 | Anthropic | 54.500% | |
| #17 | Alibaba | 54.475% | |
| #18 | Grok | 53.812% | |
| #19 | Grok | 53.506% | |
| #20 | OpenAI | 53.405% | |
| #21 | Z.ai | 53.182% | |
| #22 | Alibaba | 52.785% | |
| #23 | Grok | 52.448% | |
| #24 | Grok | 52.295% | |
| #25 | OpenAI | 52.151% | |
| #26 | OpenAI | 51.928% | |
| #27 | 50.788% | ||
| #28 | Moonshot AI | 50.622% | |
| #29 | MiniMax | 48.402% | |
| #30 | OpenAI | 47.801% | |
| #31 | 47.598% | ||
| #32 | Anthropic | 46.931% | |
| #33 | 46.123% | ||
| #34 | Mistralai | 46.113% | |
| #35 | Grok | 46.084% | |
| #36 | Z.ai | 45.977% | |
| #37 | Alibaba | 45.639% | |
| #38 | Grok | 44.362% | |
| #39 | Alibaba | 44.295% | |
| #40 | 41.589% | ||
| #41 | MiniMax | 38.579% | |
| #42 | Moonshot AI | 36.647% | |
| #43 | Z.ai | 36.480% | |
| #44 | MiniMax | 33.350% | |
| #45 | Fireworks | 21.541% | |
| #46 | Mistralai | 18.049% | |
| #47 | OpenAI | 8.064% | |
| #48 | Cohere | 4.226% | |
| #49 | Fireworks | 2.345% | |
| #50 | AI21 Labs | 0.370% |
6. DeepSWE v1.1:真实仓库修代码
DeepSWE 给 Agent 真实、耗时较长的软件工程任务。模型需要理解代码库、修改代码并提交补丁,最后在干净的验证容器中运行测试。
v1.1 有 113 项任务,当前快照更新于 2026 年 8 月 26 日。榜单统一使用同一套 Agent 框架,比分散的厂商自报成绩更容易横向比较。
当前展示:Best 视图 19 个模型(全部)
| 名次 | 模型 | 厂商 | Pass@1 |
|---|---|---|---|
| #1 | Anthropic | 74% ± 4% | |
| #2 | OpenAI | 73% ± 3% | |
| #3 | Anthropic | 70% ± 4% | |
| #4 | ZAI.png | 69% ± 3% | |
| #5 | Moonshot.png | 69% ± 5% | |
| #6 | OpenAI | 67% ± 4% | |
| #7 | OpenAI | 67% ± 6% | |
| #8 | xAI | 67% ± 2% | |
| #9 | 65% ± 2% | ||
| #10 | ZAI.png | 63% ± 4% | |
| #11 | DeepSeek | 63% ± 6% | |
| #12 | Anthropic | 59% ± 2% | |
| #13 | Qwen.png | 57% ± 3% | |
| #14 | Meta | 55% ± 2% | |
| #15 | Anthropic | 54% ± 4% | |
| #16 | DeepSeek | 53% ± 4% | |
| #17 | 47% ± 4% | ||
| #18 | ZAI.png | 44% ± 2% | |
| #19 | 36% ± 4% |
7. TapTap Maker:让模型真的做游戏
TapTap Maker 要求 AI Agent 为 UrhoX 引擎编写 Lua 游戏代码,再由真实引擎执行和评分,不靠另一个大模型主观打分。
当前使用 2026-08-27-v5 快照。前三名分数很接近,而且第二、第三名置信区间较宽,所以更应该看作同一领先梯队。
当前展示:29 个配置(全部)
| 名次 | 模型 | 厂商 | 原榜分数 |
|---|---|---|---|
| #1 | Anthropic | 89.02% | |
| #2 | Anthropic | 88.89% | |
| #3 | xAI | 87.30% | |
| #4 | OpenAI | 86.51% | |
| #5 | Anthropic | 86.51% | |
| #6 | 84.13% | ||
| #7 | xAI | 84.13% | |
| #8 | Z.ai | 83.60% | |
| #9 | Anthropic | 82.76% | |
| #10 | Alibaba | 82.54% | |
| #11 | OpenAI | 81.75% | |
| #12 | Alibaba | 81.48% | |
| #13 | Z.ai | 81.48% | |
| #14 | Moonshot AI | 79.72% | |
| #15 | xAI | 78.31% | |
| #16 | OpenAI | 77.78% | |
| #17 | DeepSeek | 77.78% | |
| #18 | 76.19% | ||
| #19 | Anthropic | 76.19% | |
| #20 | DeepSeek | 74.60% | |
| #21 | Z.ai | 74.34% | |
| #22 | Anthropic | 73.28% | |
| #23 | Tencent | 73.02% | |
| #24 | ByteDance | 72.75% | |
| #25 | Alibaba | 68.25% | |
| #26 | 64.70% | ||
| #27 | 63.89% | ||
| #28 | MiniMax | 60.05% | |
| #29 | Anthropic | 43.65% |
怎么选榜单
- 想看综合能力:Artificial Analysis、LiveBench。
- 想看真人使用偏好:LMArena Text。
- 想做网页和前端:LMArena WebDev。
- 想让 Agent 完成专业办公长任务:APEX-Agents。
- 想做金融研究:Vals Finance Agent。
- 想做软件工程:DeepSWE。
- 想做游戏开发:TapTap Maker。
最实用的办法不是只追一个总榜,而是先确定自己的任务,再看对应榜单;最后用自己的真实工作做一轮小测试。榜单负责缩小范围,实际任务才负责最终选择。