LMArena 综合 Elo 榜(人类盲测偏好)
数据源:LMArena / Swfte 聚合 · 更新至 2026-09-10
由匿名人类盲测投票生成,反映真实使用偏好;Anthropic 占 5 席、OpenAI 3 席,头部差距极小。
- 1Claude Mythos 5Anthropic1531
- 2Claude Fable 5Anthropic1525
- 3Claude Opus 5Anthropic1522
- 4GPT-5.6 SolOpenAI1514
- 5Claude Opus 4.8Anthropic1512
- 6GPT-5.5 ProOpenAI1510
- 7GPT-5.5OpenAI1506
- 8Claude Opus 4.7Anthropic1505
- 9Gemini 3.1 ProGoogle DeepMind1505
- 10Kimi K3月之暗面1500
Elo 分数越高代表在盲测中越受人类偏好。
Artificial Analysis 智能指数榜
数据源:Artificial Analysis v4.3 · 更新至 2026-09-08
综合推理、编码与智能体任务(Terminal-Bench 4.0 / AutomationBench)的标准化指数;Claude Fable 5.1 与 GPT-6 Astra 并列第一。
- 1Claude Fable 5.1 (max)Anthropic53
- 1GPT-6 Astra (max)OpenAI53
- 3Claude Fable 5.1 (high)Anthropic51
- 3GPT-6 Astra (high)OpenAI51
- 3Claude Opus 5 (max)Anthropic51
- 6Claude Fable 5Anthropic50
- 6GPT-6 Astra (medium)OpenAI50
- 6Claude Opus 5 (xhigh)Anthropic50
- 9GLM-5.3 (max)智谱 AI44
- 9Kimi K3 (max)月之暗面44
- 11Qwen3.8 2.4T A95B阿里 Qwen40
智能指数 v4.3,满分 100,越高越强;不同档位(max/high)代表推理预算差异。
SWE-bench Verified 编程能力榜
数据源:Steel / BenchLM 聚合 · 更新至 2026-09-04
在 500 个真实 GitHub Issue 上的修复通过率;Claude 5 系列主导,前三名均超 95%。
- 1Claude Opus 5Anthropic97.0
- 2Claude Mythos 5Anthropic95.5
- 3Claude Fable 5Anthropic95.0
- 4Claude Mythos PreviewAnthropic93.9
- 5Claude Opus 4.8Anthropic88.6
- 6Claude Opus 4.7Anthropic87.6
- 7GPT-5.6 SolOpenAI82.2
- 8Ornith-1.5-397BOrby AI86.0
- 9Claude Sonnet 5Anthropic85.2
- 10GPT-5.3 CodexOpenAI85.0
解决率 % 越高,代表真实代码仓库问题修复能力越强。
SuperCLUE 中文通用模型榜
数据源:SuperCLUE 通用总榜 · 更新至 2026-07(最新公开版)
中文场景综合能力评测;国内模型已进入全球第一梯队,阿里 Qwen、DeepSeek、智谱、月之暗面领跑。
- 1Qwen3.8-Max-0902 (max)阿里巴巴72.6
- 1DeepSeek-V4.1-Flash (max)深度求索71.8
- 2Qwen3.8-Max (max)阿里巴巴71.5
- 2GLM-5.3 (max)智谱 AI71.3
- 2Kimi-K3 (max)月之暗面70.7
- 3DeepSeek-V4-Pro-0813 (max)深度求索70.1
- 4GLM-5.3-Flash (max)智谱 AI68.1
- 5Qwen3.8-Flash (max)阿里巴巴66.4
- 5Doubao-Seed-2.1-pro (high)字节跳动65.9
- 5DeepSeek-V4-Flash (max)深度求索65.6
总分 100;1 分以内视为并列。