7 个 AI 模型榜单怎么看:最新排名与用途

2026-09-02 · AI · 模型评测 · EN

AI 模型没有一个万能分数。有人擅长聊天,有人擅长写代码,还有人能操作软件完成长任务。下面这 7 个榜单,正好从不同角度看模型能力。

排名采集于 2026 年 9 月 2 日。榜单更新很快,分数只适合比较同一榜单、同一版本和同一配置。

LMArena 同时维护 Text 和 WebDev 两张榜,所以 7 个来源会看到 8 组排名。Artificial Analysis 还提供中文/多语言分榜,本文放在对应章节说明。

1. Artificial Analysis:综合能力

它把推理、知识、编程、指令遵循和 Agent 等多项测试合成一个 Intelligence Index。适合快速判断模型的综合上限,但不能代表价格、速度或具体业务体验。

当前展示:28 个有效配置(全部)

名次 模型 厂商 原榜分数
#1 Claude Fable 5.1 (max with fallback) Anthropic 65.7
#2 Claude Fable 5.1 (xhigh with fallback) Anthropic 64.8
#3 Claude Opus 5 (max) Anthropic 63.1
#4 Claude Opus 5 (xhigh) Anthropic 62.5
#5 Claude Fable 5.1 (high with fallback) Anthropic 62.5
#6 Claude Fable 5 (with fallback) Anthropic 62.1
#7 GPT-5.6 Sol (max) OpenAI 60.9
#8 Grok 4.6 (high) SpaceXAI 60.9
#9 Kimi K3 (max) Kimi 59.7
#10 GLM-5.3 (max) Z AI 59.5
#11 Qwen3.8 2.4T A95B Alibaba 57.7
#12 GLM-5.3-Flash Z AI 57.5
#13 Muse Spark 1.2 (xhigh) Meta 56.8
#14 GPT-5.6 Terra (max) OpenAI 56.6
#15 Gemini 3.7 Flash (high) Google 56.0
#16 DeepSeek V4 Pro 0813 (max) DeepSeek 53.2
#17 GPT-5.6 Luna (max) OpenAI 52.3
#18 Qwen3.8 27B (xhigh) Alibaba 52.0
#19 MiniMax-M3 MiniMax 45.4
#20 Inkling Thinking Machines 42.3
#21 Nemotron 3 Ultra NVIDIA 38.3
#22 Gemini 3.5 Flash-Lite Google 37.4
#23 Muse Glimmer (high) Meta 35.1
#24 Mistral Medium 3.5 Mistral 30.4
#25 Claude 4.5 Haiku Anthropic 29.9
#26 gpt-oss-120b (high) OpenAI 24.1
#27 Nemotron 3.5 Lightning NVIDIA 23.6
#28 Command A+ Cohere 22.8

中文/多语言榜更适合关注中文表现。当前中文前三名为:Claude Opus 4.6 Max、Gemini 3.1 Pro Preview、Gemini 3 Pro Preview High,三者均为 94 分。

查看 Intelligence Index · 查看多语言榜

2. LiveBench:不断换题的客观考试

LiveBench 覆盖数学、推理、编程、数据分析、语言和指令遵循等任务。题目会持续更新,答案按客观规则评分,目的是减少模型背过测试题带来的虚高。

它适合看模型的基础解题能力。当前公开快照包含 23 项任务、7 个类别,发布日期为 2026 年 6 月 25 日。

当前展示:Top 50/51 个配置

名次 模型 厂商 原榜分数
#1 claude-fable-5-1-max-effort Anthropic 83.414
#2 claude-fable-5-max-effort Anthropic 82.971
#3 gpt-5.6-sol-max OpenAI 81.054
#4 gpt-5.5-xhigh OpenAI 80.188
#5 claude-opus-5-max-effort Anthropic 80.085
#6 smaug-agentic Other 79.508
#7 kimi-k3 Moonshot AI 79.193
#8 gemini-3.7-flash-high Google 78.826
#9 qwen3.8-max Alibaba 78.461
#10 grok-4.6 xAI 78.042
#11 gpt-5.4-xhigh OpenAI 77.972
#12 muse-spark-1.2-xhigh Meta 77.955
#13 gpt-5.6-terra-max OpenAI 77.936
#14 deepseek-v4-pro-0813 DeepSeek 77.436
#15 gemini-3.1-pro-preview-high Google 76.952
#16 deepseek-v4-flash-vision-exp DeepSeek 76.758
#17 claude-opus-4-7-xhigh-effort Anthropic 76.529
#18 claude-opus-4-8-max-effort Anthropic 76.224
#19 qwen3.8-flash-next Alibaba 76.194
#20 glm-5.3 Z.ai 76.138
#21 claude-sonnet-5-xhigh-effort Anthropic 76.040
#22 grok-4.5 xAI 75.773
#23 muse-spark-1.1-xhigh Meta 75.300
#24 qwen3.8-27b Alibaba 75.269
#25 gemini-3.5-flash-high Google 74.638
#26 gpt-5.2-2025-12-11-high OpenAI 74.635
#27 claude-opus-4-6-thinking-auto-high-effort Anthropic 74.520
#28 deepseek-v4-flash-0731 DeepSeek 74.171
#29 gpt-5.2-codex OpenAI 73.975
#30 gemini-3.6-flash-high Google 73.588
#31 gpt-5.6-luna-max OpenAI 73.559
#32 glm-5.2 Z.ai 73.157
#33 qwen3.7-max Alibaba 73.137
#34 claude-sonnet-4-6-thinking-auto-medium-effort Anthropic 72.990
#35 claude-opus-4-5-20251101-thinking-64k-high-effort Anthropic 72.582
#36 inkling-xhigh Other 71.922
#37 glm-5.3-flash Z.ai 71.591
#38 deepseek-v4-pro DeepSeek 71.572
#39 kimi-k2.6-thinking Moonshot AI 70.539
#40 gpt-5.4-nano-xhigh OpenAI 69.576
#41 ox-alpha-max Other 69.235
#42 qwen3.6-plus Alibaba 68.906
#43 kimi-k2.7-code Moonshot AI 68.412
#44 grok-build-0.1 xAI 67.781
#45 minimax-m3 MiniMax 67.257
#46 gpt-5.4-mini-xhigh OpenAI 66.374
#47 deepseek-v4-flash DeepSeek 65.481
#48 nemotron-3-ultra-550b-a55b NVIDIA 64.155
#49 qwen3.6-27b Alibaba 64.027
#50 gemini-3.5-flash-lite-high Google 63.937

查看 LiveBench

3. LMArena:真人盲选

LMArena 不给模型做标准卷,而是让用户同时看到两个匿名答案,再投票选更好的一个。它更接近真实使用偏好,但结果也会受提问人群、回答风格和投票量影响。

  • Text:看聊天、写作、数学、编程等开放问题。
  • WebDev:看模型生成网页和前端应用的实际效果。

当前展示:Text Top 50;WebDev 20 个实验室(全部)

分榜 名次 模型 厂商 Arena 分数
Text #1 claude-fable-5 Anthropic 1508±5
Text #2 claude-opus-4-6-high Anthropic 1505±4
Text #3 claude-opus-4-7-high Anthropic 1502±4
Text #4 muse-spark-1.2 (xHigh) Meta 1499±10
Text #5 claude-opus-4-6 Anthropic 1498±3
Text #6 claude-opus-4-7 Anthropic 1494±4
Text #7 claude-opus-5-high Anthropic 1492±5
Text #8 muse-spark-1.1 Meta 1491±5
Text #9 gemini-3.7-flash-high Google 1491±8Preliminary
Text #10 kimi-k3-max Moonshot 1489±5
Text #11 muse-spark Meta 1488±6
Text #12 claude-opus-5-max Anthropic 1488±6
Text #13 gemini-3.1-pro-preview Google 1487±3
Text #14 gemini-3-pro Google 1486±4
Text #15 gpt-5.6-sol-xhigh OpenAI 1483±5
Text #16 gpt-5.5-high OpenAI 1482±4
Text #17 glm-5.3-max Z.ai 1482±7
Text #18 claude-opus-4-8-high Anthropic 1482±4
Text #19 gemini-3.6-flash-high Google 1480±5
Text #20 qwen3.8-max Alibaba 1479±6
Text #21 gemini-3.5-flash-high Google 1479±4
Text #22 gpt-5.5 OpenAI 1477±4
Text #23 gpt-5.4-high OpenAI 1477±4
Text #24 gpt-5.2-chat-latest-20260210 OpenAI 1476±4
Text #25 gemini-3.5-flash-medium Google 1475±5
Text #26 grok-4.20-beta1 SpaceXAI 1475±5
Text #27 gemini-3-flash Google 1474±4
Text #28 qwen3.7-max-preview Alibaba 1474±10
Text #29 gpt-5.5-instant OpenAI 1474±5
Text #30 glm-5.3-flash Z.ai 1473±9
Text #31 claude-opus-4-8 Anthropic 1473±4
Text #32 claude-opus-4-5-20251101-high-32k Anthropic 1473±4
Text #33 claude-sonnet-4-6 Anthropic 1472±4
Text #34 grok-4.20-beta-0309-reasoning SpaceXAI 1472±4
Text #35 glm-5.2-max Z.ai 1472±5
Text #36 grok-4.20-multi-agent-beta-0309 SpaceXAI 1470±4
Text #37 grok-4.5 SpaceXAI 1470±5
Text #38 claude-opus-4-5-20251101 Anthropic 1469±3
Text #39 mimo-v2.5-pro Xiaomi 1468±4
Text #40 ernie-5.1 Baidu 1468±5
Text #41 gpt-5.6-terra-xhigh OpenAI 1466±5
Text #42 glm-5.1 Z.ai 1466±4
Text #43 gpt-5.4 OpenAI 1466±4
Text #44 qwen3.5-max-preview Alibaba 1466±5
Text #45 grok-4.1-thinking SpaceXAI 1465±3
Text #46 claude-sonnet-5-high Anthropic 1462±5
Text #47 grok-4.6-high SpaceXAI 1461±10Preliminary
Text #48 kimi-k2.6 Moonshot 1461±5
Text #49 qwen3.6-max-preview Alibaba 1460±8
Text #50 deepseek-v4-pro-high-20260813 DeepSeek 1459±8
WebDev #1 qwen3.8-max-0902 Alibaba 1691+19/-19Preliminary
WebDev #2 claude-opus-5-max Anthropic 1687+8/-8
WebDev #3 kimi-k3-max Moonshot AI 1674+11/-11
WebDev #4 SpaceXAIgrok-4.6-high Other 1629+17/-17Preliminary
WebDev #5 Tencenthy4-preview Tencent 1627+17/-17Preliminary
WebDev #6 gpt-5.6-sol-xhigh (codex-harness) OpenAI 1616+7/-7
WebDev #7 Z.aiglm-5.3-max Other 1609+13/-13
WebDev #8 gemini-3.7-flash-high Google 1587+12/-12Preliminary
WebDev #9 deepseek-v4-pro-high-20260813 DeepSeek 1583+11/-11
WebDev #10 MetaMetamuse-spark-1.1 Other 1540+8/-8
WebDev #11 BytedanceBytedanceseed-2.1-pro-preview Other 1522+8/-8
WebDev #12 MiniMaxminimax-m3 Other 1487+7/-7
WebDev #13 Xiaomimimo-v2.5-pro Other 1476+6/-6
WebDev #14 Thinking MachinesThinkyinkling Other 1408+8/-8
WebDev #15 Upstagesolar-pro4 Other 1371+17/-17
WebDev #16 Poolsidelaguna-m.1 Other 1347+10/-10
WebDev #17 Mistralmistral-medium-3.5 Other 1265+15/-15
WebDev #18 KAT-Coder-Pro-V1 Other 1254+20/-20
WebDev #19 granite-4.1-8b IBM 1192+19/-19
WebDev #20 mercury-2 Inception AI 1166+25/-25

WebDev 第一名 Qwen 3.8 Max 0902 仍标为 Preliminary,样本增加后名次可能变化。Text 前三名的置信区间也高度重叠,不宜把几分差距理解为明显胜负。

查看 Text 榜 · 查看 WebDev 榜

4. APEX-Agents:专业人士的长任务

APEX-Agents 测试模型能否像投行分析师、管理顾问和公司律师一样工作。任务需要跨多个应用查资料、做分析、写文件,并持续规划较长流程。

它包含 33 个工作场景、480 项任务。相比普通问答榜,它更能反映 Agent 能否把复杂工作真正做完。

当前展示:默认 Mean Score + Loop 的 28 个配置(全部)

名次 模型 厂商 Mean Score
#1 Fable 5.1 Max Anthropic 62.0% ± 3.5%
#2 Opus 5 Max Anthropic 60.6% ± 3.6%
#3 Fable 5.1 High Anthropic 60.0% ± 3.5%
#4 Fable 5 Max Anthropic 59.2% ± 3.7%
#5 Muse Spark 1.1 Xhigh Meta 58.1% ± 3.4%
#6 Grok 4.6 High xAI 57.5% ± 3.5%
#7 GPT-5.6 Sol Max OpenAI 56.7% ± 3.3%
#8 GPT-5.6 Sol Max OpenAI 56.4% ± 3.4%
#9 Opus 4.8 Max Anthropic 56.2% ± 3.5%
#10 GPT-5.5 Xhigh OpenAI 55.5% ± 3.6%
#11 Kimi K3 Max Kimi 55.4% ± 3.3%
#12 GPT-5.6 Sol Xhigh OpenAI 54.3% ± 3.3%
#13 GLM-5.2 Zhipu 52.2% ± 3.5%
#14 DeepSeek-V4-Flash Max DeepSeek 51.6% ± 3.4%
#15 GPT-5.4 Xhigh OpenAI 51.3% ± 3.6%
#16 Opus 4.7 Max Anthropic 50.1% ± 3.5%
#17 Opus 4.6 High Anthropic 48.7% ± 3.5%
#18 Gemini 3.1 Pro High Google 48.7% ± 3.3%
#19 Sonnet 5 High Anthropic 48.5% ± 3.2%
#20 GPT-5.2 Xhigh OpenAI 47.8% ± 3.7%
#21 Grok 4.5 High xAI 47.1% ± 3.4%
#22 Gemini 3 Pro High Google 46.7% ± 3.4%
#23 GPT-5.3-Codex High OpenAI 44.6% ± 3.4%
#24 GPT-5.2-Codex High OpenAI 42.5% ± 3.2%
#25 Kimi K2.7 Code Auto Kimi 41.9% ± 3.0%
#26 Applied Compute: Small Applied Compute 40.1% ± 3.2%
#27 Opus 4.5 High Anthropic 37.1% ± 3.2%
#28 GLM-4.7 Zhipu 21.2% ± 2.2%

查看 APEX-Agents

5. Vals Finance Agent:金融分析办公题

这个榜单专门测试金融分析任务,例如查阅公司资料和 SEC 文件、建立判断并给出有依据的回答。它适合选金融研究助手,不适合用来判断通用聊天或编程能力。

这里列的是当前页面提供的 Finance Agent v1.1 Accuracy,快照更新于 2026 年 6 月 4 日。榜首约 64%,也说明复杂金融研究离“完全可靠”还有距离。

当前展示:Top 50/51 个模型

名次 模型 厂商 Accuracy
#1 claude-opus-4-7 Anthropic 64.373%
#2 claude-sonnet-4-6 Anthropic 63.331%
#3 muse-spark Meta 60.595%
#4 deepseek-v4-pro DeepSeek 60.389%
#5 claude-opus-4-6-thinking Anthropic 60.046%
#6 gpt-5.5 OpenAI 59.963%
#7 gemini-3.1-pro-preview Google 59.717%
#8 claude-opus-4-5-20251101-thinking Anthropic 58.810%
#9 gpt-5.2-2025-12-11 OpenAI 58.535%
#10 glm-5.1 Z.ai 57.655%
#11 gpt-5.4-2026-03-05 OpenAI 57.152%
#12 kimi-k2.6 Moonshot AI 57.056%
#13 gpt-5.1-2025-11-13 OpenAI 55.309%
#14 gemini-3-pro-preview Google 55.154%
#15 qwen3.6-plus Alibaba 54.627%
#16 claude-sonnet-4-5-20250929-thinking Anthropic 54.500%
#17 qwen3.5-plus-thinking Alibaba 54.475%
#18 grok-4.3 Grok 53.812%
#19 grok-4-0709 Grok 53.506%
#20 gpt-5.4-mini-2026-03-17 OpenAI 53.405%
#21 glm-5-thinking Z.ai 53.182%
#22 qwen3.6-max-preview Alibaba 52.785%
#23 grok-4-1-fast-reasoning Grok 52.448%
#24 grok-4.20-0309-reasoning Grok 52.295%
#25 gpt-5-2025-08-07 OpenAI 52.151%
#26 gpt-5-mini-2025-08-07 OpenAI 51.928%
#27 gemma-4-31b-it Google 50.788%
#28 kimi-k2.5-thinking Moonshot AI 50.622%
#29 MiniMax-M2.7 MiniMax 48.402%
#30 gpt-5.4-nano-2026-03-17 OpenAI 47.801%
#31 gemini-3-flash-preview Google 47.598%
#32 claude-haiku-4-5-20251001-thinking Anthropic 46.931%
#33 gemini-3.1-flash-lite-preview Google 46.123%
#34 mistral-medium-3.5 Mistralai 46.113%
#35 grok-4-fast-reasoning Grok 46.084%
#36 glm-4.7 Z.ai 45.977%
#37 qwen3.5-flash Alibaba 45.639%
#38 grok-4-1-fast-non-reasoning Grok 44.362%
#39 qwen3-max Alibaba 44.295%
#40 gemini-2.5-pro Google 41.589%
#41 MiniMax-M2.5 MiniMax 38.579%
#42 kimi-k2-thinking Moonshot AI 36.647%
#43 glm-4.6 Z.ai 36.480%
#44 MiniMax-M2.1 MiniMax 33.350%
#45 gpt-oss-120b Fireworks 21.541%
#46 mistral-large-2512 Mistralai 18.049%
#47 gpt-4o-2024-08-06 OpenAI 8.064%
#48 command-a-03-2025 Cohere 4.226%
#49 deepseek-v3p2-thinking Fireworks 2.345%
#50 jamba-large-1.7 AI21 Labs 0.370%

查看 Vals Finance Agent

6. DeepSWE v1.1:真实仓库修代码

DeepSWE 给 Agent 真实、耗时较长的软件工程任务。模型需要理解代码库、修改代码并提交补丁,最后在干净的验证容器中运行测试。

v1.1 有 113 项任务,当前快照更新于 2026 年 8 月 26 日。榜单统一使用同一套 Agent 框架,比分散的厂商自报成绩更容易横向比较。

当前展示:Best 视图 19 个模型(全部)

名次 模型 厂商 Pass@1
#1 claude-opus-5 max Anthropic 74% ± 4%
#2 gpt-5.6-sol max OpenAI 73% ± 3%
#3 claude-fable-5 max Anthropic 70% ± 4%
#4 glm-5.3 max ZAI.png 69% ± 3%
#5 kimi-k3 max Moonshot.png 69% ± 5%
#6 gpt-5.6-luna max OpenAI 67% ± 4%
#7 gpt-5.5 xhigh OpenAI 67% ± 6%
#8 grok-4.6 xhigh xAI 67% ± 2%
#9 gemini-3.7-flash high Google 65% ± 2%
#10 glm-5.3-flash max ZAI.png 63% ± 4%
#11 deepseek-v4-pro max DeepSeek 63% ± 6%
#12 claude-opus-4.8 max Anthropic 59% ± 2%
#13 qwen3.8-max xhigh Qwen.png 57% ± 3%
#14 muse-spark-1.2 xhigh Meta 55% ± 2%
#15 claude-sonnet-5 max Anthropic 54% ± 4%
#16 deepseek-v4-flash max DeepSeek 53% ± 4%
#17 gemini-3.6-flash high Google 47% ± 4%
#18 glm-5.2 max ZAI.png 44% ± 2%
#19 gemini-3.5-flash high Google 36% ± 4%

查看 DeepSWE v1.1

7. TapTap Maker:让模型真的做游戏

TapTap Maker 要求 AI Agent 为 UrhoX 引擎编写 Lua 游戏代码,再由真实引擎执行和评分,不靠另一个大模型主观打分。

当前使用 2026-08-27-v5 快照。前三名分数很接近,而且第二、第三名置信区间较宽,所以更应该看作同一领先梯队。

当前展示:29 个配置(全部)

名次 模型 厂商 原榜分数
#1 claude-fable-5 high Anthropic 89.02%
#2 claude-opus-5 xhigh Anthropic 88.89%
#3 grok-4.6 xhigh xAI 87.30%
#4 gpt-5.6-sol xhigh OpenAI 86.51%
#5 claude-opus-5 high Anthropic 86.51%
#6 gemini-3.7-flash high Google 84.13%
#7 grok-4.6 high xAI 84.13%
#8 glm-5.3 max Z.ai 83.60%
#9 claude-opus-4-8 xhigh Anthropic 82.76%
#10 qwen3.8-max xhigh Alibaba 82.54%
#11 gpt-5.6-terra xhigh OpenAI 81.75%
#12 qwen3.8-flash xhigh Alibaba 81.48%
#13 glm-5.3-flash max Z.ai 81.48%
#14 kimi-k3 Moonshot AI 79.72%
#15 x-ai/grok-4.5 high xAI 78.31%
#16 gpt-5.6-luna xhigh OpenAI 77.78%
#17 deepseek-v4-pro DeepSeek 77.78%
#18 gemini-3.6-flash Google 76.19%
#19 claude-opus-4-6 xhigh Anthropic 76.19%
#20 deepseek-v4-flash max DeepSeek 74.60%
#21 glm-5.2 Z.ai 74.34%
#22 claude-sonnet-5 xhigh Anthropic 73.28%
#23 hy3 Tencent 73.02%
#24 doubao-seed-evolving high ByteDance 72.75%
#25 qwen3.8-27b xhigh Alibaba 68.25%
#26 gemini-3.1-pro-preview Google 64.70%
#27 gemini-3.5-flash Google 63.89%
#28 MiniMax/MiniMax-M3 MiniMax 60.05%
#29 claude-haiku-4-5 high Anthropic 43.65%

查看 TapTap Maker

怎么选榜单

  • 想看综合能力:Artificial Analysis、LiveBench。
  • 想看真人使用偏好:LMArena Text。
  • 想做网页和前端:LMArena WebDev。
  • 想让 Agent 完成专业办公长任务:APEX-Agents。
  • 想做金融研究:Vals Finance Agent。
  • 想做软件工程:DeepSWE。
  • 想做游戏开发:TapTap Maker。

最实用的办法不是只追一个总榜,而是先确定自己的任务,再看对应榜单;最后用自己的真实工作做一轮小测试。榜单负责缩小范围,实际任务才负责最终选择。

已复制短链