每日 08:00 自动更新 · 权威模型汇总与排名

AI 模型排行榜

权威榜单 · 一目了然

汇总 LMArena、Artificial Analysis、SWE-bench Verified、SuperCLUE 等权威榜单,附近期新模型速览,帮你快速掌握模型格局。

更新至 2026-09-13每日 08:00 更新榜单口径不同,请勿跨榜直接对比分数
01

权威模型排行

LMArena 综合 Elo 榜(人类盲测偏好)

数据源:LMArena / Swfte 聚合 · 更新至 2026-09-10

由匿名人类盲测投票生成,反映真实使用偏好;Anthropic 占 5 席、OpenAI 3 席,头部差距极小。

  • 1Claude Mythos 5Anthropic1531
  • 2Claude Fable 5Anthropic1525
  • 3Claude Opus 5Anthropic1522
  • 4GPT-5.6 SolOpenAI1514
  • 5Claude Opus 4.8Anthropic1512
  • 6GPT-5.5 ProOpenAI1510
  • 7GPT-5.5OpenAI1506
  • 8Claude Opus 4.7Anthropic1505
  • 9Gemini 3.1 ProGoogle DeepMind1505
  • 10Kimi K3月之暗面1500

Elo 分数越高代表在盲测中越受人类偏好。

Artificial Analysis 智能指数榜

数据源:Artificial Analysis v4.3 · 更新至 2026-09-08

综合推理、编码与智能体任务(Terminal-Bench 4.0 / AutomationBench)的标准化指数;Claude Fable 5.1 与 GPT-6 Astra 并列第一。

  • 1Claude Fable 5.1 (max)Anthropic53
  • 1GPT-6 Astra (max)OpenAI53
  • 3Claude Fable 5.1 (high)Anthropic51
  • 3GPT-6 Astra (high)OpenAI51
  • 3Claude Opus 5 (max)Anthropic51
  • 6Claude Fable 5Anthropic50
  • 6GPT-6 Astra (medium)OpenAI50
  • 6Claude Opus 5 (xhigh)Anthropic50
  • 9GLM-5.3 (max)智谱 AI44
  • 9Kimi K3 (max)月之暗面44
  • 11Qwen3.8 2.4T A95B阿里 Qwen40

智能指数 v4.3,满分 100,越高越强;不同档位(max/high)代表推理预算差异。

SWE-bench Verified 编程能力榜

数据源:Steel / BenchLM 聚合 · 更新至 2026-09-04

在 500 个真实 GitHub Issue 上的修复通过率;Claude 5 系列主导,前三名均超 95%。

  • 1Claude Opus 5Anthropic97.0
  • 2Claude Mythos 5Anthropic95.5
  • 3Claude Fable 5Anthropic95.0
  • 4Claude Mythos PreviewAnthropic93.9
  • 5Claude Opus 4.8Anthropic88.6
  • 6Claude Opus 4.7Anthropic87.6
  • 7GPT-5.6 SolOpenAI82.2
  • 8Ornith-1.5-397BOrby AI86.0
  • 9Claude Sonnet 5Anthropic85.2
  • 10GPT-5.3 CodexOpenAI85.0

解决率 % 越高,代表真实代码仓库问题修复能力越强。

SuperCLUE 中文通用模型榜

数据源:SuperCLUE 通用总榜 · 更新至 2026-07(最新公开版)

中文场景综合能力评测;国内模型已进入全球第一梯队,阿里 Qwen、DeepSeek、智谱、月之暗面领跑。

  • 1Qwen3.8-Max-0902 (max)阿里巴巴72.6
  • 1DeepSeek-V4.1-Flash (max)深度求索71.8
  • 2Qwen3.8-Max (max)阿里巴巴71.5
  • 2GLM-5.3 (max)智谱 AI71.3
  • 2Kimi-K3 (max)月之暗面70.7
  • 3DeepSeek-V4-Pro-0813 (max)深度求索70.1
  • 4GLM-5.3-Flash (max)智谱 AI68.1
  • 5Qwen3.8-Flash (max)阿里巴巴66.4
  • 5Doubao-Seed-2.1-pro (high)字节跳动65.9
  • 5DeepSeek-V4-Flash (max)深度求索65.6

总分 100;1 分以内视为并列。

02

近期新模型速览

近两个月发布的重点模型,快速掌握最新格局

GPT-6 Astra

OpenAI · 2026-09-09

面向工作场景的下一代旗舰:推理、计算机操作、编程、安全与科学能力全面升级。

Claude Fable 5.1 / Mythos 5.1

Anthropic · 2026-09-01

Claude 5 系列更新,强化编程、知识工作与长程 Agent 任务。

Gemini 3.8 Flash

Google DeepMind · 2026-09-02

面向软件工程与 Agentic 场景的快速迭代版本,附带网络安全专用变体。

DeepSeek-V4.1-Flash

深度求索 · 2026-09-10

更小、更快、更高吞吐,原生视觉理解,数学推理突出。

Qwen3.8-Max-0902

阿里巴巴 · 2026-09-10

中文综合能力第一梯队,幻觉控制与智能体任务规划表现突出。

Kimi K3

月之暗面 · 2026-07-16

2.8 万亿参数开源模型,100 万 token 上下文,原生视觉支持。

GLM-5.3-Flash

智谱 AI · 2026-08-26

原生多模态,强调代码、浏览器与图形界面协同闭环。

Llama 4 Maverick 2

Meta · 2026-09-03

开放权重路线延续,推理能力进一步提升。

Grok 4.6

xAI · 2026-08-12

面向长程 Agent、代码库处理与视觉化工作流。