modelbenchmark.io

Best AI for coding

Ranked by the coding composite: SWE-bench Verified, Aider polyglot and MirrorCode. Full leaderboard.

RankModelLabCompositeEvidenceOut $/M
1Claude Fable 5.1Anthropic100th10 bench · 2 src$50.00
2o3-pro99th1 bench · 1 src$88.00
3gemini-2.5-pro-preview-06-0598th1 bench · 1 src
4Grok 4xAI98th6 bench · 2 src$15.00
5gemini-2.5-pro-preview-06-0597th1 bench · 1 src
6o3 (high) + gpt-4.196th1 bench · 1 src
7Claude Fable 5Anthropic95th14 bench · 2 src$50.00
8Gemini 2.5 Pro Preview 05-0695th1 bench · 1 src$10.00
9GPT 5OpenAI94th13 bench · 3 src$10.00
10Gemini 2.5 Pro Preview 03-2593rd1 bench · 1 src$10.00
11Doubao-Seed-CodeByteDance92nd1 bench · 1 src$1.12
12GLM-5.2Zhipu92nd10 bench · 2 src$4.40
13DeepSeek v4DeepSeek91st7 bench · 1 src
14DeepSeek R190th1 bench · 1 src
15Qwen3.7-MaxAlibaba89th10 bench · 2 src$9.00
16Claude Opus 4.6Anthropic88th4 bench · 1 src
17claude-opus-4-2025051488th1 bench · 1 src
18Claude 4.5 OpusAnthropic87th1 bench · 1 src$25.00
19Qwen3.6 Max PreviewAlibaba86th7 bench · 1 srcfree
20Kimi K2.6Kimi85th12 bench · 2 src$4.00
21Claude Opus 4.5Anthropic85th6 bench · 1 src
22MiniMax M2.5MiniMax84th1 bench · 1 src$1.20
23Gemini 3.1 Pro PreviewGoogle83rd1 bench · 1 src$12.00
24Gemini 3 Flash PreviewGoogle82nd10 bench · 2 src$3.00
25Claude 4.6 OpusAnthropic81st1 bench · 1 src$25.00
26Gemini 3.5 FlashGoogle81st14 bench · 3 src$9.00
27Claude Sonnet 4.6Anthropic80th2 bench · 1 src
28GPT-5.3 CodexOpenAI79th1 bench · 1 src$14.00
29Claude Opus 4Anthropic78th7 bench · 2 src$75.00
30GLM-5.1Zhipu78th8 bench · 1 src$4.40
31Claude Opus 4.1Anthropic77th10 bench · 1 src$75.00
32Gemini 3 Pro PreviewGoogle76th6 bench · 2 src$9.60
33GPT 5.2 CodexOpenAI75th2 bench · 2 src$14.00
34GLM 5Zhipu74th6 bench · 2 src$3.2647
35o3OpenAI74th11 bench · 3 src$8.00
36GPT 5.2OpenAI73rd12 bench · 3 src$14.00
37Kimi K2.5Kimi72nd7 bench · 2 src$1.90
38Claude 4.5 SonnetAnthropic71st1 bench · 1 src$15.00
39DeepSeek-V3.2-ExpDeepSeek71st7 bench · 3 src$0.326
40Claude Sonnet 4.5Anthropic70th8 bench · 1 src
41DeepSeek R1 + claude-3-5-sonnet-2024102269th1 bench · 1 src
42Claude 4 SonnetAnthropic68th1 bench · 1 src$15.00
43Claude 4 OpusAnthropic67th1 bench · 1 src$75.00
44Claude Opus 4.7Anthropic67th13 bench · 2 src$25.00
45claude-3-7-sonnet-2025021966th1 bench · 1 src
46GPT-6 AstraOpenAI65th11 bench · 2 src$50.00
47Qwen3 235B A22B diff, no think, Alibaba API64th1 bench · 1 src
48Claude Sonnet 4Anthropic64th7 bench · 3 src$15.00
49o1-2024-12-17OpenAI63rd9 bench · 3 src$60.00
50Claude 4.5 HaikuAnthropic62nd1 bench · 1 src$5.00
51GPT 5.1OpenAI61st8 bench · 2 src$10.00
52o4-miniOpenAI61st12 bench · 3 src$4.40
53Claude 3.7 SonnetAnthropic60th7 bench · 3 src$15.00
54GPT 5.1 CodexOpenAI59th1 bench · 1 src$10.00
55DeepSeek R1DeepSeek58th4 bench · 2 src$1.70
56claude-sonnet-4-2025051457th1 bench · 1 src
57MultipleAnthropic57th1 bench · 1 src
58gemini-2.5-flash-preview-05-2056th1 bench · 1 src
59DeepSeek V355th1 bench · 1 src
60Kimi K2 InstructKimi54th7 bench · 3 srcfree
61Quasar Alpha54th1 bench · 1 src
62Claude 3.7 Sonnet w/ Review HeavyAnthropic53rd1 bench · 1 src
63swe-searchAnthropic52nd1 bench · 1 src
64Grok 3 BetaxAI51st6 bench · 2 src
65Optimus Alpha50th1 bench · 1 src
66MiniMax M2MiniMax50th1 bench · 1 src$1.53
67GPT-5.4OpenAI49th13 bench · 2 src$15.00
68GPT 5 miniOpenAI48th11 bench · 2 src$2.00
69GPT-5.5OpenAI47th16 bench · 2 src$30.00
70TTSOpenAI47th1 bench · 1 src
71Qwen3.6 PlusAlibaba46th9 bench · 2 src$3.00
72DeepSeek Chat V345th1 bench · 1 src
73gemini-2.5-flash-preview-04-1744th1 bench · 1 src
74Devstral SmallMistral43rd1 bench · 1 src
75Qwen3-Coder-30B-A3B-InstructAlibaba43rd1 bench · 1 src$0.60
76Claude 3.5 SonnetAnthropic42nd2 bench · 2 src$15.00
77Gemini 2.5 ProGoogle41st8 bench · 2 src$10.00
78Qwen3-Coder 480B/A35B InstructAlibaba40th1 bench · 1 src$1.80
79GLM 4.6Zhipu40th3 bench · 2 src$1.40
80GPT-4.5OpenAI39th4 bench · 2 src$150.00
81GLM 4.5Zhipu38th3 bench · 2 src$1.30
82gemini-2.5-flash-preview-05-2037th1 bench · 1 src
83O3 MiniOpenAI36th12 bench · 3 src$4.40
84DevstralMistral36th1 bench · 1 src
85Frogboss 32B 2510Microsoft35th1 bench · 1 src
86GPT 4.1OpenAI34th10 bench · 3 src$8.00
87Grok 3 Mini Beta33rd1 bench · 1 src
88Qwen3 32BAlibaba33rd4 bench · 2 src$0.55
89gemini-exp-120632nd1 bench · 1 src
90chatgpt-4o-latest31st1 bench · 1 src$14.00
91TTSAlibaba30th1 bench · 1 src
92DevStral Small 2505Mistral30th1 bench · 1 src
93Gemini 2.0 Pro exp-02-0529th1 bench · 1 src$7.956
94Frogmini 14B 2510Microsoft28th1 bench · 1 src
95GPT-5.6 SolOpenAI27th12 bench · 2 src$10.00
96o1-miniOpenAI26th5 bench · 2 src$4.40
97Amazon.nova Premier v1:0Amazon26th1 bench · 1 src
98DeepSWE-PreviewAgentica25th1 bench · 1 src
99Llama3-SWE-RL-70BMeta24th1 bench · 1 src
100Claude 3.5 HaikuAnthropic23rd2 bench · 2 src$4.00
101SWE-agent-LM-32BAlibaba23rd1 bench · 1 src
102gpt-oss-120bOpenAI22nd6 bench · 3 src$0.798
103QwQ-32B + Qwen 2.5 Coder Instruct21st1 bench · 1 src
104DevStral Small 2507Mistral20th1 bench · 1 src
105GPT 5 nanoOpenAI19th11 bench · 2 src$0.40
106qwen-max-2025-01-2519th1 bench · 1 src$6.392
107Gemini 3.1 Pro PreviewGoogle18th12 bench · 2 src$12.00
108QwQ 32BAlibaba17th4 bench · 2 src$0.861
109GPT 4.1 miniOpenAI16th10 bench · 3 src$1.60
110Gemini 2.0 Flash ThinkingGoogle16th6 bench · 3 src$0.42
111GPT 4oOpenAI15th9 bench · 3 src$10.00
112gemini-2.0-flash-thinking-exp-01-2114th1 bench · 1 src
113Qwen2.5Alibaba13th1 bench · 1 src
114DeepSeek Chat V2.512th1 bench · 1 src
115Gemini 2.5 FlashGoogle12th2 bench · 2 src$2.50
116yi-lightning11th1 bench · 1 src
117command-a-03-2025-quality10th1 bench · 1 src
118Codestral 25.019th1 bench · 1 src
119Llama 4 Maverick InstructMeta9th6 bench · 3 src$0.60
120Qwen2.5 Coder 32B InstructAlibaba8th2 bench · 2 src$1.00
121openhands-lm-32b-v0.17th1 bench · 1 src
122GPT-4.1 nanoOpenAI6th6 bench · 2 src$0.40
123MCTS Refine 7B5th1 bench · 1 src
124Gemma 3 27BGoogle5th5 bench · 2 srcfree
125GPT-4o miniOpenAI4th8 bench · 2 src$0.60
126GPT-4OpenAI3rd1 bench · 1 src
127Claude 3 OpusAnthropic2nd6 bench · 2 src$75.00
128Llama 4 Scout InstructMeta2nd5 bench · 2 src$0.46
129Claude 2Anthropic1st4 bench · 2 src
130SWE-Llama 7BMeta0th1 bench · 1 src

Common questions

What is the best ai for coding right now?
Ranked by the coding composite: SWE-bench Verified, Aider polyglot and MirrorCode.
How is this ranking computed?
It is the same family composite as the leaderboard. Each benchmark is weighted by how much of its spread survives its own measurement error.