MModelIndexAI model benchmarksSnapshot · August 2026

Every frontier AI model, one dashboard.

Filter by lab, capability or price. Sort by what matters — coding, math, science, human preference. Compare up to four models side by side.

32 models13 labs6 benchmarksUpdated Aug 2026
Sort by

32 of 32 models

OAOpenAIJun 2026

GPT-5.5

#1 Overall #1 Science

Frontier reasoning + agent execution

IDX 91.4
SWE-bench83
GPQA93.6
AIME100
Context
256K
In / Out
$1.75 / $14
Elo
1508
Details
xAxAIMay 2026

Grok 4.5

#1 Coding

Fast, cheap coding agents

IDX 90.5
SWE-bench86.6
GPQA90
AIME98
Context
256K
In / Out
$2.50 / $10
Elo
1502
Details
AnAnthropicMar 2026

Claude Opus 4.7

Sustained complex coding

IDX 86.0
SWE-bench84.5
GPQA89.2
AIME82
Context
200K
In / Out
$5 / $25
Elo
1495
Details
DMGoogle DeepMindFeb 2026

Gemini 3.1 Pro

Multimodal research at 1M context

IDX 88.8
SWE-bench79.5
GPQA92.6
AIME95
Context
1M
In / Out
$2 / $12
Elo
1496
Details
OAOpenAIDec 2025

GPT-5.2

#1 Math

Research & hard reasoning

IDX 90.1
SWE-bench80
GPQA92.4
AIME100
Context
400K
In / Out
$1.75 / $14
Elo
1490
Details
AnAnthropicNov 2025

Claude Opus 4.5

Frontier coding agents

IDX 82.5
SWE-bench80.9
GPQA87
AIME75
Context
200K
In / Out
$5 / $25
Elo
1481
Details
DMGoogle DeepMindNov 2025

Gemini 3 Pro

Multimodal reasoning, strong value

IDX 87.5
SWE-bench76.2
GPQA91.9
AIME95
Context
1M
In / Out
$2 / $12
Elo
1445
Details
OAOpenAINov 2025

GPT-5.1

Adaptive-effort coding agents

IDX 87.4
SWE-bench76.3
GPQA91.5
AIME94.6
Context
400K
In / Out
$1.25 / $10
Elo
1478
Details
KiMoonshot AINov 2025

Kimi K2 Thinking

Open deep reasoning + agents

Open weightsIDX 85.2
SWE-bench71.3
GPQA84.5
AIME99
Context
256K
In / Out
$0.60 / $2.50
Elo
1450
Details
xAxAIOct 2025

Grok 4.1

Real-time X data + reasoning

IDX 86.9
SWE-bench74.5
GPQA89
AIME98
Context
256K
In / Out
$3 / $15
Elo
1497
Details
MMMiniMaxOct 2025

MiniMax-M2

Ultra-cheap agent workflows

Open weightsIDX 79.3
SWE-bench69.4
GPQA78
AIME90
Context
204K
In / Out
$0.30 / $1.20
Elo
1425
Details
AnAnthropicOct 2025

Claude Haiku 4.5

Near-frontier at low latency

IDX 77.7
SWE-bench73.3
GPQA78.1
AIME77.2
Context
200K
In / Out
$1 / $5
Elo
1420
Details
GLZ.ai (Zhipu)Sep 2025

GLM-4.6

Open coding & agents

Open weightsIDX 81.8
SWE-bench68.2
GPQA81
AIME93.9
Context
200K
In / Out
$0.60 / $2.20
Elo
1440
Details
AnAnthropicSep 2025

Claude Sonnet 4.5

Coding price/performance sweet spot

IDX 83.3
SWE-bench77.2
GPQA83.4
AIME87
Context
200K
In / Out
$3 / $15
Elo
1457
Details
DSDeepSeekSep 2025

DeepSeek-V3.2

Best value

Best open price/performance

Open weightsIDX 82.5
SWE-bench70
GPQA82
AIME93.1
Context
160K
In / Out
$0.28 / $0.42
Elo
1440
Details
QwAlibaba · QwenSep 2025

Qwen3-Max

Multilingual enterprise API

IDX 82.2
SWE-bench69.6
GPQA82
AIME92
Context
262K
In / Out
$1.20 / $6
Elo
1438
Details
OAOpenAIAug 2025

GPT-5

General-purpose flagship

IDX 86.2
SWE-bench74.9
GPQA88.4
AIME94.6
Context
400K
In / Out
$1.25 / $10
Elo
1443
Details
OAOpenAIAug 2025

GPT-5 mini

Fast, cheap everyday tasks

IDX 82.4
SWE-bench68.6
GPQA85
AIME91.5
Context
400K
In / Out
$0.25 / $2
Elo
1398
Details
AnAnthropicAug 2025

Claude Opus 4.1

Long-horizon agents (premium tier)

IDX 81.1
SWE-bench74.5
GPQA81
AIME83
Context
200K
In / Out
$15 / $75
Elo
1442
Details
KiMoonshot AIJul 2025

Kimi K2

Open agentic tool-use

Open weightsIDX 78.0
SWE-bench65.3
GPQA79.5
AIME85
Context
128K
In / Out
$0.60 / $2.50
Elo
1420
Details
xAxAIJul 2025

Grok 4

Agentic search & reasoning

IDX 82.1
SWE-bench68
GPQA87
AIME88
Context
256K
In / Out
$3 / $15
Elo
1467
Details
DMGoogle DeepMindJun 2025

Gemini 2.5 Flash

High-throughput multimodal

IDX 75.6
SWE-bench60.4
GPQA78
AIME84
Context
1M
In / Out
$0.30 / $2.50
Elo
1400
Details
MiMistral AIJun 2025

Mistral Medium 3.1

EU-hosted, multilingual

IDX 74.3
SWE-bench68
GPQA74
AIME74
Context
128K
In / Out
$0.40 / $2
Elo
1375
Details
QwAlibaba · QwenApr 2025

Qwen3-235B-A22B

Open hybrid thinking model

Open weightsIDX 71.9
SWE-bench52
GPQA70
AIME85.7
Context
262K
In / Out
$0.20 / $0.60
Elo
1370
Details
OAOpenAIApr 2025

o3

Legacy deep-reasoning workhorse

IDX 82.1
SWE-bench69.1
GPQA83.3
AIME91.6
Context
200K
In / Out
$2 / $8
Elo
1425
Details
OAOpenAIApr 2025

GPT-4.1

Long-context (1M) workloads

IDX 61.9
SWE-bench54.6
GPQA74
AIME35
Context
1M
In / Out
$2 / $8
Elo
1367
Details
MeMetaApr 2025

Llama 4 Maverick

Open multimodal at scale

Open weightsIDX 62.6
SWE-bench43
GPQA69.8
AIME57.2
Context
1M
In / Out
$0.27 / $0.85
Elo
1418
Details
MeMetaApr 2025

Llama 4 Scout

Ultra-long 10M-token context

Open weightsIDX 52.3
SWE-bench30
GPQA61
AIME43
Context
10M
In / Out
$0.11 / $0.34
Elo
1360
Details
DMGoogle DeepMindMar 2025

Gemini 2.5 Pro

Proven long-context all-rounder

IDX 81.1
SWE-bench63.8
GPQA86.4
AIME88
Context
1M
In / Out
$1.25 / $10
Elo
1470
Details
CoCohereMar 2025

Command A

Private enterprise RAG

Open weightsIDX 59.0
SWE-bench70.1
GPQA58
AIME30
Context
256K
In / Out
$2.50 / $10
Elo
1275
Details
MSMicrosoftFeb 2025

Phi-4

On-device / edge inference

Open weightsIDX 54.8
SWE-bench35
GPQA56.1
AIME50
Context
16K
In / Out
$0.07 / $0.14
Elo
1288
Details
DSDeepSeekJan 2025

DeepSeek-R1

The open reasoning pioneer

Open weightsIDX 69.6
SWE-bench49.2
GPQA71.5
AIME79.8
Context
128K
In / Out
$0.55 / $2.19
Elo
1392
Details

About the data. Scores are compiled from official lab announcements and public leaderboards (LMArena, SWE-bench, Artificial Analysis) as of August 2026. Numbers vary by harness, sampling settings and eval date, and some recently released models carry estimated figures — verify with the provider before making decisions. Index is the mean of MMLU-Pro, GPQA Diamond, AIME and SWE-bench Verified. Prices are standard API rates per 1M tokens in USD.

ModelIndex · built with Next.js & Tailwind CSS · not affiliated with any lab