Claude Opus 4.8
Top of the LLM Stats overall board; leading on deep coding.
Arena
1521
Arena
1521
SWE
81.2
AIME
95.8
GPQA
90.4
MMLU
87.9
Aider
88.5
OS
44.1
Compare models from OpenAI, Anthropic, Google, xAI, Meta, DeepSeek, Qwen and Mistral. Filter by lab, sort by the benchmark that matters, and line them up side-by-side.
17
Models tracked
Claude Opus 4.8
Current Arena leader
Claude Opus 4.8
Newest release
5
Open-weights models
Leaderboard
Sort by any benchmark, filter by lab or tier. Scores are the best reported figures — hover a column header for what it measures.
| # | Model | Arena | SWE | AIME | GPQA | MMLU | Aider | OS | Context | Price (in/out) | |
|---|---|---|---|---|---|---|---|---|---|---|---|
Claude Opus 4.8 Anthropic · Jun 3, 2026 | 1521 | 81.2 | 95.8 | 90.4 | 87.9 | 88.5 | 44.1 | 500K | $15 / $75 | ||
| 2 | GPT-5.5 OpenAI · May 14, 2026 | 1512 | 74.9 | 96.4 | 89.1 | 86.7 | 84.2 | 42.0 | 400K | $2.50 / $10 | |
| 3 | Gemini 3.1 Pro Google · May 20, 2026 | 1505 | 72.0 | 97.1 | 91.2 | 86.4 | 80.3 | 40.6 | 2M | $2.50 / $10 | |
| 4 | Grok 4.3 xAI · May 28, 2026 | 1498 | 75.8 | 95.0 | 87.3 | 85.0 | 83.0 | 36.5 | 256K | $3.00 / $15 | |
| 5 | Claude Sonnet 4.6 Anthropic · Mar 18, 2026 | 1486 | 73.4 | 92.0 | 84.5 | 84.0 | 82.1 | 38.9 | 500K | $3.00 / $15 | |
| 6 | Llama 4 Behemoth Meta · Apr 29, 2026 | 1469 | 66.0 | 92.5 | 83.1 | 83.5 | 77.4 | 28.5 | 1M | Open | |
| 7 | DeepSeek V4 DeepSeek · Apr 12, 2026 | 1461 | 64.5 | 93.2 | 82.4 | 82.0 | 74.0 | 25.0 | 128K | Open | |
| 8 | GPT-5.1 OpenAI · Oct 20, 2025 | 1458 | 68.5 | 94.2 | 88.0 | 85.1 | 79.6 | 38.4 | 400K | $1.50 / $6.00 | |
| 9 | Gemini 3 Flash Google · Apr 8, 2026 | 1451 | 60.1 | 90.4 | 82.0 | 82.0 | 73.5 | 30.2 | 1M | $0.30 / $2.50 | |
| 10 | Qwen3-Max Qwen · Mar 24, 2026 | 1444 | 58.9 | 89.0 | 80.5 | 80.2 | 70.5 | 21.5 | 256K | $0.50 / $2.00 | |
| 11 | Mistral Large 3 Mistral · Feb 25, 2026 | 1429 | 52.6 | 82.0 | 78.0 | 78.5 | 67.2 | 16.5 | 128K | $2.00 / $6.00 | |
| 12 | Grok 4 Fast xAI · Mar 2, 2026 | 1422 | 49.7 | 86.0 | 76.8 | 78.5 | 66.2 | 18.0 | 131K | $0.20 / $1.50 | |
| 13 | Llama 4 Maverick Meta · Jan 15, 2026 | 1417 | 54.3 | 84.0 | 77.9 | 79.0 | 69.8 | 20.0 | 1M | Open | |
| 14 | Qwen3-235B Qwen · Feb 7, 2026 | 1408 | 48.2 | 81.0 | 75.0 | 76.8 | 63.0 | 14.0 | 131K | Open | |
| 15 | GPT-5.1 mini OpenAI · Nov 4, 2025 | 1402 | 51.2 | 88.5 | 78.3 | 78.9 | 68.4 | 22.0 | 200K | $0.40 / $1.60 | |
| 16 | Claude Haiku 4.6 Anthropic · Feb 11, 2026 | 1395 | 44.8 | 80.1 | 71.2 | 75.4 | 61.0 | 15.5 | 250K | $0.80 / $4.00 | |
| 17 | Codestral 2 Mistral · Jan 30, 2026 | 1372 | 47.0 | — | 65.0 | 70.0 | 76.5 | — | 256K | Open |
Top of the LLM Stats overall board; leading on deep coding.
Arena
1521
Arena
1521
SWE
81.2
AIME
95.8
GPQA
90.4
MMLU
87.9
Aider
88.5
OS
44.1
Arena
1512
SWE
74.9
AIME
96.4
GPQA
89.1
MMLU
86.7
Aider
84.2
OS
42.0
Arena
1505
SWE
72.0
AIME
97.1
GPQA
91.2
MMLU
86.4
Aider
80.3
OS
40.6
Arena
1498
SWE
75.8
AIME
95.0
GPQA
87.3
MMLU
85.0
Aider
83.0
OS
36.5
Arena
1486
SWE
73.4
AIME
92.0
GPQA
84.5
MMLU
84.0
Aider
82.1
OS
38.9
Meta's largest open-weights model, near-frontier quality.
Arena
1469
Arena
1469
SWE
66.0
AIME
92.5
GPQA
83.1
MMLU
83.5
Aider
77.4
OS
28.5
Frontier-class reasoning at a fraction of the price.
Arena
1461
Arena
1461
SWE
64.5
AIME
93.2
GPQA
82.4
MMLU
82.0
Aider
74.0
OS
25.0
Arena
1458
SWE
68.5
AIME
94.2
GPQA
88.0
MMLU
85.1
Aider
79.6
OS
38.4
Arena
1451
SWE
60.1
AIME
90.4
GPQA
82.0
MMLU
82.0
Aider
73.5
OS
30.2
Arena
1444
SWE
58.9
AIME
89.0
GPQA
80.5
MMLU
80.2
Aider
70.5
OS
21.5
Arena
1429
SWE
52.6
AIME
82.0
GPQA
78.0
MMLU
78.5
Aider
67.2
OS
16.5
Arena
1422
SWE
49.7
AIME
86.0
GPQA
76.8
MMLU
78.5
Aider
66.2
OS
18.0
Arena
1417
SWE
54.3
AIME
84.0
GPQA
77.9
MMLU
79.0
Aider
69.8
OS
20.0
Open-weights MoE with a thriving community ecosystem.
Arena
1408
Arena
1408
SWE
48.2
AIME
81.0
GPQA
75.0
MMLU
76.8
Aider
63.0
OS
14.0
Arena
1402
SWE
51.2
AIME
88.5
GPQA
78.3
MMLU
78.9
Aider
68.4
OS
22.0
Arena
1395
SWE
44.8
AIME
80.1
GPQA
71.2
MMLU
75.4
Aider
61.0
OS
15.5
Arena
1372
SWE
47.0
AIME
—
GPQA
65.0
MMLU
70.0
Aider
76.5
OS
—
Methodology
Each column maps to a specific, publicly reported eval. Click through to a model for the full breakdown.
Crowdsourced head-to-head chat preference Elo from LMArena. Captures perceived helpfulness and vibe across real-world prompts.
Share of real GitHub issues a model can autonomously resolve end-to-end (with tests passing). The de-facto agentic coding benchmark.
American Invitational Mathematics Examination — competition math that rewards deep, multi-step reasoning. Reported as % solved.
Google-proof graduate-level science Q&A (physics, biology, chemistry). PhD-level questions that resist web lookup.
Harder, 10-way multiple-choice version of MMLU across 14 academic and professional domains. Breadth-of-knowledge signal.
Editing a real codebase across multiple languages. Measures practical, instruction-following coding skill (not just generation).
Computer-use / agentic benchmark: completing real desktop OS tasks (apps, files, browsers). The leading autonomy metric.