FrontierMath tiers 1-3
Mathematics · fixed question set
The lower three difficulty tiers of FrontierMath v2.
How far to trust it
Same private construction as FrontierMath v1. Reasoning effort moves this score more than any other benchmark on the site, so a figure with no effort setting attached says very little.
Measured
Models scored
85
Spread between models
26.0
standard deviation, points
Measurement noise
2.6
published stderr
Weight
0.99
share of spread that is signal
The weight is (spread² − noise²) / spread². It is computed, never chosen. Most of this benchmark's spread is real, so it still separates models.
Every model scored
the median across configurations, so one heroic run cannot lead
| Rank | Model | Lab | Score |
|---|---|---|---|
| 1 | GPT-6 Astra | OpenAI | 93.7 |
| 2 | Claude Fable 5.1 | Anthropic | 90.2 |
| 3 | GPT-5.6 Sol | OpenAI | 89.1 |
| 4 | GPT-5.5 Pro | OpenAI | 87.7 |
| 5 | Claude Fable 5 | Anthropic | 87.0 |
| 6 | GPT-5.6 Terra | OpenAI | 86.0 |
| 7 | Claude Opus 5 | Anthropic | 85.6 |
| 8 | GPT-5.5 | OpenAI | 85.3 |
| 9 | GPT-5.4 Pro | OpenAI | 82.5 |
| 10 | Claude Opus 4.8 | Anthropic | 80.0 |
| 11 | GPT-5.4 | OpenAI | 78.6 |
| 12 | Qwen3.8 Max | Alibaba | 74.7 |
| 13 | GPT-5.2 Pro | OpenAI | 74.0 |
| 14 | Kimi K3 | Kimi | 72.2 |
| 15 | Gemini 3.7 Flash | 71.6 | |
| 16 | Claude Opus 4.7 | Anthropic | 70.2 |
| 17 | GLM-5.3 | Zhipu | 68.8 |
| 18 | Gemini 3.8 Flash | 68.4 | |
| 19 | GPT 5.2 | OpenAI | 67.4 |
| 20 | Claude Opus 4.6 | Anthropic | 66.0 |
| 21 | Grok 4.6 | xAI | 66.0 |
| 22 | Claude Sonnet 5 | Anthropic | 65.6 |
| 23 | Qwen3.8 Max (0902) | Alibaba | 65.6 |
| 24 | DeepSeek V4 Pro 0813 | DeepSeek | 64.6 |
| 25 | Qwen3.7-Max | Alibaba | 64.6 |
| 26 | Gemini 3.5 Flash | 62.8 | |
| 27 | GPT-5.6 Luna | OpenAI | 61.8 |
| 28 | Gemini 3.1 Pro Preview | 59.6 | |
| 29 | Gemini 3.6 Flash | 59.0 | |
| 30 | DeepSeek V4 Flash 0731 | DeepSeek | 57.5 |
| 31 | Grok 4.5 | xAI | 57.2 |
| 32 | Kimi K2.6 | Kimi | 57.2 |
| 33 | GLM-5.2 | Zhipu | 57.0 |
| 34 | GLM-5.3-Flash | Zhipu | 55.8 |
| 35 | GPT-5 Pro | OpenAI | 55.8 |
| 36 | Kimi K2.7 Code | Kimi | 54.0 |
| 37 | Gemini 3 Flash Preview | 51.2 | |
| 38 | Inkling Small | Thinking Machines | 46.3 |
| 39 | DeepSeek v4 | DeepSeek | 45.3 |
| 40 | Grok 4.20 | xAI | 44.9 |
| 41 | Grok 4.3 Beta | xAI | 42.8 |
| 42 | GLM-5.2 | Zhipu | 42.5 |
| 43 | GPT-5.6 Luna | OpenAI | 39.6 |
| 44 | Qwen3.6 Plus | Alibaba | 38.2 |
| 45 | GPT-5.4 mini | OpenAI | 37.9 |
| 46 | GPT 5 | OpenAI | 37.2 |
| 47 | Qwen3.6 27B | Alibaba | 35.1 |
| 48 | Claude Opus 4.5 | Anthropic | 34.4 |
| 49 | Qwen3.7 Plus | Alibaba | 34.4 |
| 50 | Qwen3.6 27B | Alibaba | 34.0 |
| 51 | Inkling | Thinking Machines | 33.3 |
| 52 | GPT-5.4 nano | OpenAI | 32.6 |
| 53 | Qwen3.6 Plus | Alibaba | 32.3 |
| 54 | Qwen3.5 397B-A17B | Alibaba | 31.2 |
| 55 | GLM-5.1 | Zhipu | 30.9 |
| 56 | Qwen3.5 397B-A17B | Alibaba | 29.5 |
| 57 | GPT 5 mini | OpenAI | 29.4 |
| 58 | o3 | OpenAI | 27.5 |
| 59 | o4-mini | OpenAI | 27.0 |
| 60 | GPT-5.5 Instant | OpenAI | 26.3 |
| 61 | Gemini 3.5 Flash-Lite | 26.0 | |
| 62 | Gemini 2.5 Pro | 24.6 | |
| 63 | Claude Sonnet 4.5 | Anthropic | 23.9 |
| 64 | Gemini 3.1 Flash-Lite | 22.5 | |
| 65 | Qwen3.6 Flash | Alibaba | 22.5 |
| 66 | Qwen3.6 35B-A3B | Alibaba | 20.4 |
| 67 | Qwen3.7 Flash | Alibaba | 19.3 |
| 68 | Qwen3.7 Flash | Alibaba | 19.3 |
| 69 | Qwen3 Max | Alibaba | 18.9 |
| 70 | Qwen3.5 Flash | Alibaba | 18.2 |
| 71 | Qwen3.6 35B-A3B | Alibaba | 17.5 |
| 72 | GPT-5.4 mini | OpenAI | 17.2 |
| 73 | Qwen3.6 Flash | Alibaba | 17.2 |
| 74 | Claude Opus 4.1 | Anthropic | 12.6 |
| 75 | GPT 5 nano | OpenAI | 11.9 |
| 76 | o1-2024-12-17 | OpenAI | 11.1 |
| 77 | O3 Mini | OpenAI | 11.0 |
| 78 | Qwen3.5 Flash | Alibaba | 9.5 |
| 79 | GPT 4.1 mini | OpenAI | 6.7 |
| 80 | GPT 4.1 | OpenAI | 6.0 |
| 81 | GPT-5.4 nano | OpenAI | 4.6 |
| 82 | GPT-4 Turbo | OpenAI | 0.7 |
| 83 | GPT-4o mini | OpenAI | 0.7 |
| 84 | GPT 4o | OpenAI | 0.3 |
| 85 | GPT-3.5 Turbo | OpenAI | 0.0 |