OpenAI's largest and most capable general-purpose model with deep knowledge and reasoning. Delivers state-of-the-art on many benchmarks.
| Benchmark | Description | Score | Category | Bar |
|---|---|---|---|---|
| MMLU | Massive Multitask Language Understanding | 91.5% | knowledge | |
| HumanEval | Code generation accuracy | 92.1% | coding | |
| MATH | Mathematical reasoning | 94.5% | math | |
| GSM8K | Grade school math | 95.8% | math | |
| GPQA | Graduate-level science Q&A | 73.3% | reasoning | |
| HellaSwag | Common sense reasoning | 89.5% | reasoning | |
| SWE-bench | Software engineering problems | 52.4% | coding | |
| ARC-C | AI2 Reasoning Challenge | 97% | reasoning |