modelbenchmark.io
All benchmarks

FrontierMath tier 4

Mathematics · fixed question set

The hardest FrontierMath tier: problems aimed at research mathematicians.

How far to trust it

Scores are low and the set is small, so a few problems move the number a long way. Treat small gaps as noise.

Measured

Models scored
64
Spread between models
16.3
standard deviation, points
Measurement noise
3.5
published stderr
Weight
0.95
share of spread that is signal

The weight is (spread² − noise²) / spread². It is computed, never chosen. Most of this benchmark's spread is real, so it still separates models.

Every model scored

the median across configurations, so one heroic run cannot lead

View
RankModelLabScore
1Claude Fable 5Anthropic100.0
2AI Co-MathematicianGoogle47.9
3GPT-5.4OpenAI44.3
4GPT-5.5 Pro pre-releaseOpenAI39.6
5GPT-5.4 ProOpenAI37.5
6GPT-5.5OpenAI35.4
7GPT-5.2 ProOpenAI31.3
8Claude Opus 4.8Anthropic31.2
9GPT-5 ProOpenAI14.6
10Muse SparkMeta14.6
11Claude Opus 4.6Anthropic14.6
12Kimi K2.6Kimi14.6
13Claude Opus 4.7Anthropic11.5
14Claude Opus 4.6Anthropic10.4
15Gemini 2.5 Deep ThinkGoogle10.4
16Gemini 3 Pro PreviewGoogle9.4
17GPT 5.2OpenAI8.9
18Gemini 3.1 Pro PreviewGoogle8.3
19GPT 5.1OpenAI8.3
20Gemini 3.5 FlashGoogle7.3
21GLM-5.1Zhipu6.2
22GPT-5.4 nanoOpenAI6.2
23GPT 5OpenAI4.7
24Kimi K2.5Kimi4.2
25Claude Opus 4.1Anthropic4.2
26Claude Opus 4.5Anthropic4.2
27Claude Sonnet 4.5Anthropic4.2
28Gemini 2.5 FlashGoogle4.2
29Qwen3.6 PlusAlibaba4.2
30Claude Sonnet 4.6Anthropic4.2
31Claude Opus 4.5Anthropic3.1
32GPT 5 miniOpenAI2.6
33DeepSeek-V3.2-ExpDeepSeek2.1
34Gemini 2.5 ProGoogle2.1
35Gemini 3 Flash PreviewGoogle2.1
36O3 MiniOpenAI2.1
37Qwen3.6 Max PreviewAlibaba2.1
38o4-miniOpenAI2.1
39Claude Haiku 4.5Anthropic2.1
40GPT-5.4 miniOpenAI2.1
41Grok 4 HeavyxAI2.1
42Qwen3.5 PlusAlibaba2.1
43GLM 4.6Zhipu1.1
44GLM 5Zhipu1.1
45Claude Opus 4Anthropic1.0
46Claude Sonnet 4.5Anthropic1.0
47Gemini 2.5 Pro PreviewGoogle1.0
48Grok 4xAI1.0
49o3OpenAI1.0
50GPT 5 nanoOpenAI0.5
51Claude 3.5 SonnetAnthropic0.0
52Claude 3.5 SonnetAnthropic0.0
53Claude 3.7 SonnetAnthropic0.0
54Claude Sonnet 4Anthropic0.0
55DeepSeek-R1DeepSeek0.0
56GLM 4.5Zhipu0.0
57GLM-4.7Zhipu0.0
58GPT 4.1OpenAI0.0
59Grok 3 BetaxAI0.0
60Grok-3 minixAI0.0
61Kimi K2 InstructKimi0.0
62Qwen3-235B-A22BAlibaba0.0
63Qwen3.5 FlashAlibaba0.0
64Qwen3.6 FlashAlibaba0.0

The benchmark's own page