Best LLM for Reasoning in 2026

Models from the last 12 months, ranked by a composite of GPQA and AIME (2026 and 2025). These benchmarks test graduate-level science, competition mathematics, and multi-step logical reasoning.

Updated automatically as new models release. Full benchmark leaderboard →

1
96.8%
avg
2
96.3%
avg
3
95.2%
avg
4
95.2%
avg
5
95.2%
avg
6
94.6%
avg
7
94.5%
avg
8
93.5%
avg
9
93.5%
avg
10
93.2%
avg
11
93.2%
avg
12
93.2%
avg
13
93.1%
avg
14
92.9%
avg
15
92.6%
avg
16
92.5%
avg
17
92.3%
avg
18
92.2%
avg
19
92.0%
avg
20
92.0%
avg
21
91.9%
avg
22
91.8%
avg
23
91.5%
avg
24
91.4%
avg
25
91.2%
avg
26
91.1%
avg
27
91.1%
avg
28
91.0%
avg
29
90.9%
avg
30
90.8%
avg
31
90.5%
avg
32
90.4%
avg
33
90.4%
avg
34
90.3%
avg
35
90.1%
avg
36
90.0%
avg
37
89.9%
avg
38
89.8%
avg
39
89.6%
avg
40
89.5%
avg
41
89.4%
avg
42
89.3%
avg
43
89.2%
avg
44
89.2%
avg
45
88.8%
avg
46
88.4%
avg
47
88.0%
avg
48
87.5%
avg
49
87.4%
avg
50
87.3%
avg
51
87.2%
avg
52
87.2%
avg
53
87.1%
avg
55
87.0%
avg
56
87.0%
avg
57
86.8%
avg
58
86.3%
avg
59
86.0%
avg
61
85.7%
avg
62
85.5%
avg
63
85.5%
avg
64
85.5%
avg
65
85.2%
avg
66
84.8%
avg
67
84.7%
avg
68
84.6%
avg
69
84.2%
avg
70
84.0%
avg
71
83.4%
avg
72
82.8%
avg
73
82.6%
avg
75
82.0%
avg
76
81.7%
avg
77
80.9%
avg
78
80.9%
avg
79
80.5%
avg
80
80.3%
avg
81
80.0%
avg
82
80.0%
avg
83
79.0%
avg
85
78.6%
avg
86
78.5%
avg
87
78.0%
avg
89
77.8%
avg
90
76.8%
avg
91
76.4%
avg
92
76.3%
avg
93
76.2%
avg
94
75.7%
avg
95
75.2%
avg
96
71.2%
avg
97
70.7%
avg
98
67.7%
avg
99
67.0%
avg
100
66.7%
avg
101
65.4%
avg
102
59.3%
avg
103
58.0%
avg
104
54.4%
avg
105
53.0%
avg
106
50.5%
avg
107
48.0%
avg
109
45.8%
avg
110
45.6%
avg
111
42.0%
avg
112
41.7%
avg
113
39.5%
avg
114
31.4%
avg
115
27.7%
avg
116
25.7%
avg
117
25.4%
avg

What makes a good reasoning model?

Reasoning benchmarks test whether a model can solve multi-step problems requiring planning, logic, and domain knowledge — not just pattern matching or retrieval.

  • GPQA (Diamond) — Questions written by PhD-level experts in biology, chemistry, and physics. Designed so that non-experts who Google the answer still fail. The gold standard for deep scientific reasoning.
  • AIME 2026 — The American Invitational Math Exam, 2026 edition. 30 hard problems, integer answers. The current math benchmark labs report — fresh numbers are resistant to training-data contamination.
  • AIME 2025 — Same format, one year earlier. Used alongside 2026 for a more stable picture of math reasoning capability.

For tasks involving complex analysis, research, legal and financial reasoning, or scientific work, a high GPQA score is the best predictor of real-world performance.

Also see: Best Coding LLM, Best Cheap LLM, Compare any two models.