Mistral AI's most powerful model with excellent multilingual capabilities, strong coding, and competitive European AI development.
| Benchmark | Description | Score | Category | Bar |
|---|---|---|---|---|
| MMLU | Massive Multitask Language Understanding | 84.9% | knowledge | |
| HumanEval | Code generation accuracy | 87.7% | coding | |
| MATH | Mathematical reasoning | 83.5% | math | |
| GSM8K | Grade school math | 88.2% | math | |
| GPQA | Graduate-level science Q&A | 49.1% | reasoning | |
| HellaSwag | Common sense reasoning | 85.7% | reasoning | |
| SWE-bench | Software engineering problems | 34.9% | coding | |
| ARC-C | AI2 Reasoning Challenge | 93% | reasoning |