Best LLM for Reasoning in 2026

Models from the last 12 months, ranked by a composite of GPQA and AIME (2026 and 2025). These benchmarks test graduate-level science, competition mathematics, and multi-step logical reasoning.

Updated automatically as new models release. Full benchmark leaderboard →

1
96.8%
avg
2
96.3%
avg
3
96.0%
avg
5
95.2%
avg
6
95.2%
avg
7
95.2%
avg
8
94.6%
avg
9
94.5%
avg
10
94.5%
avg
11
93.8%
avg
12
93.8%
avg
13
93.7%
avg
14
93.5%
avg
15
93.5%
avg
16
93.2%
avg
17
93.2%
avg
18
93.2%
avg
19
93.1%
avg
20
92.9%
avg
21
92.6%
avg
22
92.6%
avg
23
92.5%
avg
24
92.5%
avg
25
92.3%
avg
26
92.3%
avg
27
92.2%
avg
28
92.2%
avg
29
92.0%
avg
30
92.0%
avg
31
91.9%
avg
32
91.8%
avg
33
91.7%
avg
35
91.7%
avg
36
91.5%
avg
37
91.4%
avg
38
91.2%
avg
39
91.2%
avg
40
91.1%
avg
41
91.1%
avg
42
91.0%
avg
43
90.9%
avg
44
90.8%
avg
45
90.5%
avg
46
90.4%
avg
47
90.4%
avg
48
90.3%
avg
49
90.1%
avg
50
90.0%
avg
51
90.0%
avg
52
89.9%
avg
53
89.8%
avg
54
89.6%
avg
55
89.4%
avg
56
89.3%
avg
57
89.2%
avg
58
89.2%
avg
59
89.2%
avg
60
89.1%
avg
61
88.8%
avg
62
88.4%
avg
63
88.0%
avg
65
87.5%
avg
66
87.4%
avg
67
87.3%
avg
68
87.2%
avg
69
87.2%
avg
70
87.1%
avg
71
87.0%
avg
73
87.0%
avg
74
86.8%
avg
75
86.3%
avg
76
86.0%
avg
78
85.7%
avg
79
85.5%
avg
80
85.5%
avg
81
85.5%
avg
82
85.2%
avg
83
84.8%
avg
84
84.7%
avg
85
84.6%
avg
86
84.2%
avg
87
84.0%
avg
88
83.5%
avg
89
83.4%
avg
90
82.8%
avg
91
82.6%
avg
93
82.0%
avg
94
81.7%
avg
95
80.9%
avg
96
80.9%
avg
97
80.5%
avg
98
80.3%
avg
99
80.0%
avg
100
80.0%
avg
101
79.0%
avg
103
78.6%
avg
104
78.5%
avg
106
78.0%
avg
107
77.8%
avg
108
76.8%
avg
109
76.8%
avg
110
76.4%
avg
111
76.3%
avg
112
76.2%
avg
113
75.7%
avg
116
75.2%
avg
117
74.9%
avg
118
74.3%
avg
119
71.2%
avg
120
70.7%
avg
121
67.7%
avg
122
66.7%
avg
123
65.4%
avg
124
59.3%
avg
125
58.0%
avg
126
54.4%
avg
127
53.8%
avg
128
53.0%
avg
129
50.5%
avg
130
48.0%
avg
132
45.8%
avg
133
45.6%
avg
134
42.0%
avg
135
41.7%
avg
136
39.5%
avg
137
31.4%
avg
138
27.7%
avg
139
25.7%
avg
140
25.4%
avg

What makes a good reasoning model?

Reasoning benchmarks test whether a model can solve multi-step problems requiring planning, logic, and domain knowledge — not just pattern matching or retrieval.

  • GPQA (Diamond) — Questions written by PhD-level experts in biology, chemistry, and physics. Designed so that non-experts who Google the answer still fail. The gold standard for deep scientific reasoning.
  • AIME 2026 — The American Invitational Math Exam, 2026 edition. 30 hard problems, integer answers. The current math benchmark labs report — fresh numbers are resistant to training-data contamination.
  • AIME 2025 — Same format, one year earlier. Used alongside 2026 for a more stable picture of math reasoning capability.

For tasks involving complex analysis, research, legal and financial reasoning, or scientific work, a high GPQA score is the best predictor of real-world performance.

Also see: Best Coding LLM, Best Cheap LLM, Compare any two models.