Model Rankings
— Model rankings —

LLM rankings, side by side

Benchmarks, cost vs intelligence, context windows, and head-to-head comparisons across every major large language model.

ModelOverall$/1M
GPT-5.5 (xhigh)
OpenAI
56.3$11.25
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)
51.8$0.17
GPT-5.5 (medium)
OpenAI
51.4$11.25
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)
Anthropic
48.4$6.00
Gemini 3.1 Pro Preview
Google DeepMind
47.7$4.50
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)
Anthropic
44.9$10.00
GPT-5.5 (low)
OpenAI
44.5$11.25
Muse Spark
44.3$0.00
Claude Opus 4.7 (Non-reasoning, High Effort)
Anthropic
43.9$10.00
DeepSeek V4 Pro (Reasoning, High Effort)
43.7$2.17
MiMo-V2.5-Pro
42.9$1.35
Hy3
42.2$0.24
Claude Opus 4.5 (Reasoning)
Anthropic
41.9$10.00
Qwen3.6 Max Preview
41.1$2.92
GLM-5.1 (Reasoning)
41.0$2.13
GPT-5.4 mini (xhigh)
OpenAI
40.9$1.69
Gemini 3 Pro Preview (high)
40.6$4.50
Qwen3.6 Plus
40.5$1.13
GPT-5.4 nano (xhigh)
OpenAI
39.7$0.46
GLM-5-Turbo
39.1$0.00
MiniMax-M2.7
38.9$0.53
Gemini 3 Flash Preview (Reasoning)
38.7$1.13
Qwen3.6 27B (Reasoning)
37.7$1.35
DeepSeek V4 Flash (Reasoning, High Effort)
37.5$0.17
Claude 4.5 Sonnet (Reasoning)
Anthropic
37.4$6.00
Grok 4.20 0309 (Reasoning)
xAI
37.4$3.00
MiMo-V2-Omni-0327
37.3$0.80
GLM-5.1 (Non-reasoning)
36.3$2.13
GPT-5.5 (Non-reasoning)
OpenAI
35.8$11.25
Kimi K2.6 (Non-reasoning)
35.4$1.71
GLM 5V Turbo (Reasoning)
35.3$0.00
Claude Sonnet 4.6 (Non-reasoning, Low Effort)
Anthropic
35.1$6.00
KAT Coder Pro V2
34.5$0.53
Qwen3.5 397B A17B (Reasoning)
34.3$1.35
MiMo-V2-Flash (Feb 2026)
34.0$0.15
Gemini 3 Pro Preview (low)
33.9$4.50
Kimi K2 Thinking
33.5$1.07
o3-pro
OpenAI
33.3$35.00
Qwen3.5 122B A10B (Reasoning)
32.8$1.10
Qwen3.5 397B A17B (Non-reasoning)
32.7$1.35
Qwen3 Max Thinking
32.5$2.40
Qwen3.6 35B A3B (Reasoning)
32.1$0.56
MiMo-V2-Flash (Reasoning)
31.9$0.15
DeepSeek V4 Pro (Non-reasoning)
31.9$0.54
Grok 4.1 Fast (Reasoning)
xAI
31.3$0.28
Qwen3.6 27B (Non-reasoning)
31.3$1.35
Qwen3.5 Omni Plus
31.3$1.50
GPT-5.1 Codex mini (high)
OpenAI
31.3$0.69
o3
OpenAI
31.1$3.50
DeepSeek V3.1 Terminus (Reasoning)
31.1$1.91
GPT-5.4 nano (medium)
OpenAI
30.8$0.46
GPT-5.4 mini (medium)
OpenAI
30.5$1.69
Mistral Medium 3.5
30.4$3.00
Claude 4.5 Haiku (Reasoning)
Anthropic
29.9$2.00
Gemma 4 31B (Reasoning)
29.7$0.20
DeepSeek V4 Flash (Non-reasoning)
29.3$0.17
GLM-4.6 (Reasoning)
29.3$0.96
KAT-Coder-Pro V1
28.9$0.53
MiMo-V2.5-Pro (Non-reasoning)
28.4$0.54
Qwen3.5 122B A10B (Non-reasoning)
28.2$1.10
Gemini 3 Flash Preview (Non-reasoning)
27.9$1.13
Hy3-preview (Non-reasoning)
26.6$0.10
Ling-2.6-1T
26.6$0.85
Doubao Seed Code
26.5$0.00
Gemma 4 26B A4B (Reasoning)
26.1$0.20
o4-mini (high)
OpenAI
26.1$1.93
Step 3.5 Flash
26.0$0.15
DeepSeek V3.2 Exp (Reasoning)
25.9$0.32
Nemotron 3 Super 120B A12B (Reasoning)
25.7$0.35
Gemini 3.1 Flash-Lite
25.6$0.56
Qwen3 Max Thinking (Preview)
25.5$2.40
DeepSeek V3.2 (Non-reasoning)
25.1$0.32
MiMo-V2-Flash (Non-reasoning)
25.1$0.15
Qwen3.6 35B A3B (Non-reasoning)
24.6$0.84
Gemini 2.5 Flash Preview (Sep '25) (Reasoning)
24.2$0.00
Claude 4.5 Haiku (Non-reasoning)
Anthropic
24.1$2.00
gpt-oss-120b (high)
OpenAI
24.1$0.26
Kimi K2 0905
24.0$1.07
o1
OpenAI
23.9$26.25
GLM-4.7-Flash (Reasoning)
23.3$0.15
Grok 3 mini Reasoning (high)
xAI
22.9$0.35
K-EXAONE (Reasoning)
22.5$0.00
Gemma 4 31B (Non-reasoning)
22.3$0.21
Nova 2.0 Pro Preview (medium)
22.1$3.44
Mercury 2
21.9$0.38
Qwen3.5 9B (Reasoning)
21.8$0.15
Nova 2.0 Lite (high)
20.8$0.85
EXAONE 4.5 33B
20.5$0.00
Nova 2.0 Pro Preview (low)
19.8$3.44
Trinity Large Thinking
18.4$0.40
Claude Code
Anthropic
9.5
ElevenLabs Voice (v3)
ElevenLabs
9.4
Midjourney v7
Midjourney
9.3
Llama 3.3 Instruct 70B
Meta AI
9.3$0.67
FLUX.1 Pro
Black Forest Labs
9.1
Cursor Composer
Anysphere
9.0
Sora
OpenAI
8.8
GPT 5.5 Codex
OpenAI
GPT-5.5 Pro (xhigh)
OpenAI
$0.00
GPT-3.5 Turbo (0613)
OpenAI
$0.00
Gemini 3 Deep Think
$0.00
Cogito v2.1 (Reasoning)
$1.25
GPT-4o Realtime (Dec '24)
OpenAI
$0.00
EXAONE 4.5 33B (Non-reasoning)
$0.00
GPT-4o mini Realtime (Dec '24)
OpenAI
$0.00
Mi:dm K 2.5 Pro Preview
$0.00
Grok 4.3 (Beta)
xAI

Rankings data by Artificial Analysis. CSV imports cover supplementary benchmarks.