Best LLM for Reasoning in 2026

Ranked by composite reasoning score averaging GPQA, MATH, AIME 2025, and AIME 2024. These benchmarks test graduate-level science, competition mathematics, and multi-step logical reasoning.

Updated automatically as new models release. Full benchmark leaderboard →

1
97.1%
avg
2
96.9%
avg
3
95.8%
avg
4
95.2%
avg
5
95.2%
avg
6
95.2%
avg
7
94.6%
avg
8
94.1%
avg
9
93.5%
avg
10
93.5%
avg
11
93.2%
avg
12
93.2%
avg
13
93.1%
avg
14
92.9%
avg
15
92.5%
avg
16
92.2%
avg
17
92.2%
avg
18
92.1%
avg
19
92.1%
avg
20
92.0%
avg
21
92.0%
avg
22
91.9%
avg
23
91.8%
avg
24
91.5%
avg
25
91.4%
avg
26
91.4%
avg
27
91.1%
avg
28
91.1%
avg
29
91.0%
avg
30
90.9%
avg
31
90.8%
avg
32
90.5%
avg
33
90.4%
avg
34
90.3%
avg
35
90.1%
avg
36
90.0%
avg
37
90.0%
avg
38
89.9%
avg
39
89.9%
avg
40
89.8%
avg
41
89.6%
avg
42
89.6%
avg
43
89.3%
avg
44
89.3%
avg
45
89.2%
avg
46
89.2%
avg
47
88.8%
avg
48
88.4%
avg
49
87.5%
avg
50
87.4%
avg
51
87.2%
avg
52
87.1%
avg
53
87.0%
avg
55
87.0%
avg
56
86.8%
avg
57
86.5%
avg
58
86.3%
avg
59
86.2%
avg
60
86.2%
avg
61
86.0%
avg
63
85.8%
avg
64
85.8%
avg
65
85.7%
avg
66
85.5%
avg
67
85.5%
avg
68
85.3%
avg
69
85.2%
avg
70
84.8%
avg
71
84.7%
avg
72
84.6%
avg
73
84.4%
avg
74
84.2%
avg
75
84.0%
avg
76
83.4%
avg
77
83.1%
avg
78
82.8%
avg
79
82.6%
avg
82
82.1%
avg
83
82.0%
avg
84
81.7%
avg
85
81.7%
avg
86
81.5%
avg
87
80.9%
avg
88
80.9%
avg
89
80.9%
avg
90
80.8%
avg
92
80.5%
avg
93
80.3%
avg
94
80.0%
avg
95
79.3%
avg
96
79.1%
avg
97
79.0%
avg
99
78.6%
avg
100
78.0%
avg
102
77.8%
avg
103
76.5%
avg
104
76.4%
avg
105
76.2%
avg
106
75.7%
avg
107
75.2%
avg
108
74.4%
avg
109
73.7%
avg
110
73.4%
avg
111
73.3%
avg
112
71.2%
avg
113
70.7%
avg
114
70.7%
avg
115
67.7%
avg
116
67.7%
avg
117
67.3%
avg
118
66.6%
avg
119
65.5%
avg
120
65.1%
avg
121
62.9%
avg
122
60.7%
avg
123
59.3%
avg
124
58.0%
avg
125
56.0%
avg
126
54.3%
avg
127
50.5%
avg
128
48.0%
avg
130
45.8%
avg
131
45.6%
avg
132
44.4%
avg
133
42.0%
avg
134
39.5%
avg
135
31.4%
avg
136
27.7%
avg
137
25.7%
avg
138
25.4%
avg

What makes a good reasoning model?

Reasoning benchmarks test whether a model can solve multi-step problems requiring planning, logic, and domain knowledge — not just pattern matching or retrieval.

  • GPQA (Diamond) — Questions written by PhD-level experts in biology, chemistry, and physics. Designed so that non-experts who Google the answer still fail. The gold standard for deep scientific reasoning.
  • MATH — Competition mathematics at AMC/AIME difficulty. Tests multi-step algebraic and geometric reasoning.
  • AIME 2025 — The American Invitational Math Exam, 2025 edition. 30 hard problems, integer answers. Most recent math benchmark — 2025 numbers are resistant to training data contamination.
  • AIME 2024 — Same format, one year earlier. Used alongside 2025 to give a more stable picture of math reasoning capability.

For tasks involving complex analysis, research, legal and financial reasoning, or scientific work, a high GPQA score is the best predictor of real-world performance.

Also see: Best Coding LLM, Best Cheap LLM, Compare any two models.