Ranked by composite score
AI model leaderboard
One number per model, built from 16 published benchmarks across 4 sources. Each benchmark is weighted by how much of its spread survives its own measurement error, so a benchmark that no longer separates models stops counting. How the weights are computed. The quality rank uses scores only. Best per dollar is quality over output price. Speed is not in any rank. We do not sample live APIs.
79 models ranked · 3 or more benchmarks, from 2 or more sources · percentile is out of all 334 scored models either way
| Rank | Model | Lab | Composite | Evidence | Effort range | Out $/M |
|---|---|---|---|---|---|---|
| 1 | GPT-6 Astra | OpenAI | 100th | 11 bench · 2 src | 9.8 pts | $50.00 |
| 2 | Claude Fable 5 | Anthropic | 99th | 14 bench · 2 src | 7.1 pts | $50.00 |
| 3 | Claude Fable 5.1 | Anthropic | 99th | 10 bench · 2 src | — | $50.00 |
| 4 | Claude Opus 5 | Anthropic | 96th | 9 bench · 2 src | 14.0 pts | $25.00 |
| 5 | Gemini 3.8 Flash | 95th | 8 bench · 2 src | — | $3.75 | |
| 6 | GPT-5.6 Sol | OpenAI | 94th | 12 bench · 2 src | 16.2 pts | $10.00 |
| 7 | Gemini 3.7 Flash | 94th | 8 bench · 2 src | — | $3.75 | |
| 8 | GPT-5.5 | OpenAI | 93rd | 16 bench · 2 src | 21.8 pts | $30.00 |
| 9 | DeepSeek V4 Pro 0813 | DeepSeek | 91st | 8 bench · 2 src | — | $4.0077 |
| 10 | Gemini 3 Pro Preview | 91st | 6 bench · 2 src | 6.2 pts | $9.60 | |
| 11 | GPT-5.6 Terra | OpenAI | 90th | 8 bench · 2 src | 17.9 pts | $12.00 |
| 12 | Qwen3.8 Max | Alibaba | 89th | 8 bench · 2 src | — | $6.00 |
| 13 | Claude Opus 4.8 | Anthropic | 89th | 13 bench · 2 src | 3.8 pts | $25.00 |
| 14 | GPT-5.4 | OpenAI | 88th | 13 bench · 2 src | 16.7 pts | $15.00 |
| 15 | Grok 4.6 | xAI | 87th | 9 bench · 2 src | 1.1 pts | $6.00 |
| 16 | Gemini 3.1 Pro Preview | 86th | 12 bench · 2 src | 2.7 pts | $12.00 | |
| 17 | Grok 4.5 | xAI | 85th | 7 bench · 2 src | — | $6.00 |
| 18 | Kimi K3 | Kimi | 85th | 8 bench · 2 src | 16.5 pts | free |
| 19 | Gemini 3 Flash Preview | 84th | 10 bench · 2 src | 2.8 pts | $3.00 | |
| 20 | Gemini 3.6 Flash | 84th | 8 bench · 2 src | 8.1 pts | $3.75 | |
| 21 | Gemini 3.5 Flash | 84th | 14 bench · 3 src | 7.0 pts | $9.00 | |
| 22 | Claude Opus 4.7 | Anthropic | 83rd | 13 bench · 2 src | 11.1 pts | $25.00 |
| 23 | GLM-5.3 | Zhipu | 82nd | 8 bench · 2 src | — | $4.40 |
| 24 | Grok 4 | xAI | 82nd | 6 bench · 2 src | — | $15.00 |
| 25 | DeepSeek V4 Flash 0731 | DeepSeek | 81st | 8 bench · 2 src | — | $0.50 |
| 26 | Claude Sonnet 5 | Anthropic | 80th | 8 bench · 2 src | 12.5 pts | $10.00 |
| 27 | GPT-5.6 Luna | OpenAI | 80th | 8 bench · 2 src | 19.0 pts | $0.37 |
| 28 | GPT 5.2 | OpenAI | 79th | 12 bench · 3 src | 14.3 pts | $14.00 |
| 29 | Qwen3.7-Max | Alibaba | 79th | 10 bench · 2 src | — | $9.00 |
| 30 | DeepSeek R1 | DeepSeek | 78th | 4 bench · 2 src | — | $1.70 |
| 31 | GPT 5 | OpenAI | 78th | 13 bench · 3 src | 8.8 pts | $10.00 |
| 32 | o3 | OpenAI | 76th | 11 bench · 3 src | 4.2 pts | $8.00 |
| 33 | GPT 5.1 | OpenAI | 75th | 8 bench · 2 src | 8.3 pts | $10.00 |
| 34 | Claude Opus 4.6 | Anthropic | 74th | 11 bench · 2 src | 4.3 pts | $25.00 |
| 35 | Kimi K2 Instruct | Kimi | 72nd | 7 bench · 3 src | — | free |
| 36 | Kimi K2.6 | Kimi | 72nd | 12 bench · 2 src | — | $4.00 |
| 37 | Kimi K2.5 | Kimi | 71st | 7 bench · 2 src | 3.0 pts | $1.90 |
| 38 | Claude Opus 4 | Anthropic | 70th | 7 bench · 2 src | 4.6 pts | $75.00 |
| 39 | DeepSeek-V3.2-Exp | DeepSeek | 68th | 7 bench · 3 src | 10.0 pts | $0.326 |
| 40 | Qwen3.6 Plus | Alibaba | 67th | 9 bench · 2 src | — | $3.00 |
| 41 | Claude Sonnet 4 | Anthropic | 66th | 7 bench · 3 src | 11.6 pts | $15.00 |
| 42 | GLM 5 | Zhipu | 66th | 6 bench · 2 src | 0.7 pts | $3.2647 |
| 43 | GLM-5.2 | Zhipu | 66th | 10 bench · 2 src | 4.5 pts | $4.40 |
| 44 | Claude Sonnet 4.6 | Anthropic | 64th | 8 bench · 2 src | 9.3 pts | $15.94 |
| 45 | Claude 3.7 Sonnet | Anthropic | 64th | 7 bench · 3 src | 12.5 pts | $15.00 |
| 46 | Kimi K2.7 Code | Kimi | 63rd | 7 bench · 2 src | — | $4.389 |
| 47 | GPT-4.5 | OpenAI | 62nd | 4 bench · 2 src | — | $150.00 |
| 48 | Qwen3.6 27B | Alibaba | 62nd | 5 bench · 2 src | — | free |
| 49 | GLM-5.3-Flash | Zhipu | 61st | 7 bench · 2 src | — | $0.025 |
| 50 | Inkling | Thinking Machines | 61st | 7 bench · 2 src | — | $4.05 |
| 51 | Grok 3 Betanot in catalog | xAI | 59th | 6 bench · 2 src | — | — |
| 52 | o1-2024-12-17 | OpenAI | 59th | 9 bench · 3 src | — | $60.00 |
| 53 | Gemini 2.5 Pro | 57th | 8 bench · 2 src | 4.0 pts | $10.00 | |
| 54 | Claude Opus 4.5 | Anthropic | 55th | 11 bench · 2 src | 3.3 pts | $25.00 |
| 55 | o4-mini | OpenAI | 55th | 12 bench · 3 src | — | $4.40 |
| 56 | GPT 5 mini | OpenAI | 54th | 11 bench · 2 src | 3.3 pts | $2.00 |
| 57 | MiniMax M3 | MiniMax | 53rd | 5 bench · 2 src | — | $2.40 |
| 58 | GPT-5.4 mini | OpenAI | 50th | 10 bench · 2 src | 3.3 pts | $4.50 |
| 59 | o1-mini | OpenAI | 49th | 5 bench · 2 src | — | $4.40 |
| 60 | gpt-oss-120b | OpenAI | 47th | 6 bench · 3 src | — | $0.798 |
| 61 | GPT-5.4 nano | OpenAI | 46th | 10 bench · 2 src | 13.0 pts | $1.25 |
| 62 | O3 Mini | OpenAI | 42nd | 12 bench · 3 src | 6.6 pts | $4.40 |
| 63 | GPT 4.1 | OpenAI | 41st | 10 bench · 3 src | 9.0 pts | $8.00 |
| 64 | Qwen3 32B | Alibaba | 41st | 4 bench · 2 src | — | $0.55 |
| 65 | QwQ 32B | Alibaba | 41st | 4 bench · 2 src | — | $0.861 |
| 66 | GPT 5 nano | OpenAI | 40th | 11 bench · 2 src | 10.8 pts | $0.40 |
| 67 | Gemini 3.5 Flash-Lite | 39th | 7 bench · 2 src | 8.0 pts | $2.50 | |
| 68 | GLM 4.6 | Zhipu | 38th | 3 bench · 2 src | — | $1.40 |
| 69 | Gemini 2.0 Flash Thinking | 37th | 6 bench · 3 src | — | $0.42 | |
| 70 | GLM 4.5 | Zhipu | 34th | 3 bench · 2 src | — | $1.30 |
| 71 | GPT 4.1 mini | OpenAI | 31st | 10 bench · 3 src | — | $1.60 |
| 72 | Llama 4 Maverick Instruct | Meta | 29th | 6 bench · 3 src | — | $0.60 |
| 73 | Gemma 3 27B | 28th | 5 bench · 2 src | — | free | |
| 74 | GPT-4.1 nano | OpenAI | 22nd | 6 bench · 2 src | — | $0.40 |
| 75 | GPT 4o | OpenAI | 21st | 9 bench · 3 src | 2.0 pts | $10.00 |
| 76 | Llama 4 Scout Instruct | Meta | 20th | 5 bench · 2 src | — | $0.46 |
| 77 | GPT-4o mini | OpenAI | 15th | 8 bench · 2 src | — | $0.60 |
| 78 | Claude 3 Opus | Anthropic | 14th | 6 bench · 2 src | — | $75.00 |
| 79 | Claude 2not in catalog | Anthropic | 2nd | 4 bench · 2 src | — | — |
Effort range is the median spread between the same model's reasoning-effort settings, in points. It is larger than the disagreement between sources, so a score quoted without its configuration is under-specified.
Evidence counts the benchmarks behind the number and the independent sources behind those. The percentile denominator never changes with the filter.
Open weights uses the catalog flag. Closed is every catalog model without that flag. A scored model with no catalog row is neither.
Paid is a listed output price above zero. Free is a listed output price of zero. An open-weight model can have a paid API.