Best LLM for Coding in 2026

Ranked by composite coding score averaging HumanEval, SWE-bench Verified, and LiveCodeBench. All scores from official model cards and technical reports.

Updated automatically as new models release. Full benchmark leaderboard →

1
96.2%
avg
2
95.0%
avg
3
95.0%
avg
4
93.9%
avg
5
93.0%
avg
6
91.2%
avg
7
91.0%
avg
8
89.1%
avg
9
88.6%
avg
10
88.4%
avg
11
88.1%
avg
12
87.8%
avg
13
87.6%
avg
14
86.6%
avg
15
86.0%
avg
16
85.7%
avg
17
85.4%
avg
18
85.3%
avg
19
85.2%
avg
20
84.9%
avg
21
84.9%
avg
22
84.7%
avg
23
84.5%
avg
24
83.6%
avg
25
82.0%
avg
26
81.6%
avg
27
81.3%
avg
28
81.0%
avg
29
80.7%
avg
30
80.7%
avg
31
80.5%
avg
32
80.5%
avg
33
80.5%
avg
34
80.5%
avg
35
80.2%
avg
36
80.0%
avg
38
79.3%
avg
39
79.0%
avg
40
78.9%
avg
41
78.8%
avg
42
78.8%
avg
43
78.4%
avg
44
78.3%
avg
45
78.2%
avg
46
78.0%
avg
47
78.0%
avg
48
77.8%
avg
49
77.8%
avg
50
77.8%
avg
51
77.7%
avg
52
77.7%
avg
53
77.6%
avg
54
77.4%
avg
55
77.3%
avg
56
77.2%
avg
57
77.2%
avg
58
77.1%
avg
59
77.0%
avg
60
76.9%
avg
61
76.8%
avg
62
76.4%
avg
63
76.0%
avg
65
74.8%
avg
66
74.8%
avg
67
74.7%
avg
68
74.6%
avg
69
74.4%
avg
70
74.4%
avg
71
74.1%
avg
72
73.8%
avg
73
73.5%
avg
74
73.5%
avg
75
73.4%
avg
76
73.4%
avg
77
73.2%
avg
78
72.7%
avg
79
72.5%
avg
80
72.4%
avg
81
72.0%
avg
82
71.9%
avg
83
70.9%
avg
84
70.6%
avg
85
69.9%
avg
86
69.8%
avg
87
69.8%
avg
88
69.2%
avg
89
68.2%
avg
90
67.6%
avg
91
67.0%
avg
92
66.4%
avg
93
65.8%
avg
94
64.7%
avg
95
62.1%
avg
96
62.0%
avg
97
62.0%
avg
98
61.6%
avg
99
60.7%
avg
100
60.5%
avg
101
56.1%
avg
102
56.0%
avg
103
51.4%
avg
104
46.5%
avg
105
44.8%
avg
106
44.0%
avg
107
0.7%
avg

How we rank coding models

We average three industry-standard benchmarks:

  • HumanEval — Function-completion coding tasks in Python. Tests whether a model can write correct, working code from a docstring description. Pass@1 accuracy.
  • SWE-bench Verified — Real GitHub issues from popular open-source repos. Tests autonomous software engineering: read the issue, write a fix, pass the test suite. The most practical real-world coding benchmark available.
  • LiveCodeBench — Competitive programming problems from LeetCode, Codeforces, and AtCoder, collected after model training cutoffs to prevent contamination. Harder than HumanEval.

All scores are from official model cards, technical reports, or the HuggingFace Open LLM Leaderboard. Rankings update automatically as new models are released.

Also see: Best Reasoning LLM, Best Cheap LLM, Compare any two models.