modelbenchmark.io
All benchmarks

OTIS Mock AIME

Mathematics · questions rotate

Mock AIME problems written for the OTIS programme, answered as an integer from 0 to 999.

How far to trust it

Written after the models were trained, and not a public exam set, so contamination is low. The integer answer removes grader judgement. It carries the widest spread between models of any benchmark here, which makes it the strongest single discriminator.

Measured

Models scored
200
Spread between models
35.1
standard deviation, points
Measurement noise
4.9
published stderr
Weight
0.98
share of spread that is signal

The weight is (spread² − noise²) / spread². It is computed, never chosen. Most of this benchmark's spread is real, so it still separates models.

Every model scored

the median across configurations, so one heroic run cannot lead

View
RankModelLabScore
1Claude Fable 5.1Anthropic100.0
2GPT-5.5 Pro pre-releaseOpenAI100.0
3GPT-6 AstraOpenAI100.0
4Qwen3.8 Max (0902)Alibaba100.0
5Claude Fable 5Anthropic99.7
6Qwen3.8 MaxAlibaba99.4
7Gemini 3.8 FlashGoogle98.9
8DeepSeek V4 Pro 0813DeepSeek98.6
9Grok 4.6xAI98.5
10Claude Opus 4.8Anthropic98.1
11Claude Opus 5Anthropic97.8
12GPT-5.6 SolOpenAI97.8
13Grok 4.5xAI97.8
14Gemini 3.7 FlashGoogle97.2
15DeepSeek v4DeepSeek96.1
16Kimi K2.6Kimi96.1
17Gemini 3.1 Pro PreviewGoogle95.6
18Kimi K2.7 CodeKimi95.6
19Qwen3.7-MaxAlibaba95.6
20GPT-5.4OpenAI95.4
21GPT 5.2OpenAI95.0
22DeepSeek V4 Flash 0731DeepSeek94.4
23GPT-5.6 TerraOpenAI94.3
24Gemini 3 Flash PreviewGoogle94.2
25GLM-5.3-FlashZhipu93.9
26GLM-5.1Zhipu93.3
27Grok 4.3 BetaxAI93.3
28Kimi K3Kimi93.3
29Qwen3.6 PlusAlibaba93.3
30Qwen3.7 PlusAlibaba93.3
31Claude Opus 4.6Anthropic93.1
32Claude Opus 4.7Anthropic92.2
33GPT-5.5OpenAI92.2
34Grok 4.20xAI92.2
35Kimi K2.5Kimi92.2
36Gemini 3 Pro PreviewGoogle91.4
37GLM-5.3Zhipu91.1
38Qwen3.6 Max PreviewAlibaba91.1
39Qwen3.6 27BAlibaba91.1
40Inkling SmallThinking Machines90.0
41Muse SparkMeta88.9
42Gemini 3.5 FlashGoogle88.9
43gpt-oss-120bOpenAI88.9
44InklingThinking Machines88.9
45Qwen3.5 397B-A17BAlibaba88.9
46GPT-5.4 miniOpenAI88.1
47Claude Sonnet 5Anthropic87.4
48GPT 5OpenAI87.2
49Nemotron 3 UltraNVIDIA86.7
50Qwen3-235B-A22BAlibaba86.7
51Qwen3.5 PlusAlibaba86.7
52Qwen3.6 35B-A3BAlibaba86.7
53Qwen3.7 FlashAlibaba86.7
54GPT 5.1OpenAI85.6
55Claude Opus 4.8Anthropic84.4
56Qwen3.5 FlashAlibaba84.4
57Qwen3.6 FlashAlibaba84.4
58Gemini 2.5 ProGoogle84.2
59Grok 4xAI84.0
60Claude Opus 4.5Anthropic83.9
61GLM-4.7Zhipu83.3
62Kimi K2 InstructKimi83.1
63GPT-5.6 LunaOpenAI82.5
64Gemini 3.6 FlashGoogle82.2
65Gemma 4 26B-A4B ITGoogle82.2
66Qwen3.5 397B-A17BAlibaba82.2
67GLM-5.2Zhipu81.0
68GLM 5Zhipu80.0
69Qwen3.7 PlusAlibaba80.0
70Claude Sonnet 4.6Anthropic78.9
71GPT-5.4 nanoOpenAI78.3
72Claude Sonnet 4.5Anthropic77.8
73Qwen3.7 FlashAlibaba77.8
74GPT 5 miniOpenAI76.8
75o3OpenAI76.1
76GPT 5 nanoOpenAI74.2
77Gemma 4 31B ITGoogle73.3
78Qwen3 MaxAlibaba73.3
79Gemini 2.5 FlashGoogle71.9
80MiniMax M3MiniMax71.1
81o4-miniOpenAI70.9
82Grok-3 minixAI70.0
83GPT-5.6 SolOpenAI68.9
84Qwen3.6 35B-A3BAlibaba68.9
85DeepSeek-V3.2-ExpDeepSeek68.4
86GPT-5.5 InstantOpenAI68.1
87seed-oss-36b-instruct67.5
88Qwen3.6 27BAlibaba66.7
89DeepSeek-R1DeepSeek66.4
90Qwen3-30B-A3BAlibaba66.2
91Claude Opus 4.1Anthropic64.4
92GPT-5.2OpenAI62.2
93Qwen3.5-35B-A3BAlibaba62.2
94O3 MiniOpenAI61.8
95Qwen3.5 9BAlibaba61.7
96Claude Sonnet 4Anthropic61.1
97Claude Opus 4Anthropic60.0
98Gemini 3.5 Flash-LiteGoogle60.0
99QwQ 32BAlibaba59.2
100glm-4.7-flash58.3
101GPT-5.4OpenAI57.8
102GPT-5.5OpenAI57.8
103o1-2024-12-17OpenAI57.8
104Qwen3 8BAlibaba56.1
105Qwen3.5-4BAlibaba55.8
106DeepSeek-R1-Distill-Qwen-32BDeepSeek55.6
107Grok 3 BetaxAI55.6
108DeepSeek R1DeepSeek53.3
109GPT-5.6 TerraOpenAI53.3
110qwen3-4b-instruct-250752.2
111DeepSeek-R1-Distill-Llama-70BDeepSeek51.4
112Claude Haiku 4.5Anthropic51.2
113gpt-oss-20bOpenAI50.8
114DeepSeek-R1-Distill-Qwen-14BDeepSeek50.6
115Claude 3.7 SonnetAnthropic50.0
116Claude Opus 4.5Anthropic48.1
117DeepSeek v4DeepSeek46.7
118GPT-5.4 nanoOpenAI46.7
119Qwen3-14BAlibaba46.1
120o1-miniOpenAI45.8
121Qwen3 32BAlibaba45.0
122GPT 4.1 miniOpenAI44.7
123Gemini 2.0 Flash ThinkingGoogle44.4
124Gemini 3.1 Flash-LiteGoogle44.4
125Qwen3-30B-A3BAlibaba44.2
126DeepSeek-R1-052843.9
127Qwen3.5 9BAlibaba42.8
128GPT-5.6 LunaOpenAI40.0
129GPT 4.1OpenAI38.3
130DeepSeek-V3DeepSeek37.8
131GPT-4.5OpenAI37.8
132GPT-5.1OpenAI37.8
133Claude Sonnet 4.5Anthropic35.6
134Mistral Medium 3Mistral32.2
135Mistral Small 3.2Mistral30.3
136Magistral Small 1.0Mistral30.0
137GLM-5.2Zhipu28.9
138GPT-4.1 nanoOpenAI28.9
139Magistral Small 1.2Mistral28.1
140GPT-5.4 miniOpenAI26.7
141MiniMax M3MiniMax26.7
142glm-4.7-flash_none25.0
143Gemma 3 27BGoogle22.5
144Qwen3 8BAlibaba22.2
145DeepSeek-R1-Distill-Qwen-1.5BDeepSeek21.4
146Llama 4 Maverick InstructMeta20.6
147Qwen PlusAlibaba17.8
148Gemma 3 12BGoogle16.7
149Qwen2.5-MaxAlibaba16.1
150DeepSeek-V3DeepSeek15.8
151Gemini 1.5 ProGoogle14.9
152Phi-4Microsoft13.8
153Grok-2xAI11.5
154Gemini 1.5 FlashGoogle10.1
155Llama 3.1-405BMeta9.7
156Claude 3.5 SonnetAnthropic8.5
157Mistral Large 2Mistral8.1
158Qwen2.5-72BAlibaba8.1
159Qwen3-1.7BAlibaba8.1
160Llama 4 Scout InstructMeta7.8
161Gemma 3 4BGoogle7.5
162Qwen2.5-32BAlibaba7.4
163GPT-4o miniOpenAI6.9
164GPT-4 TurboOpenAI6.7
165Claude 3.5 SonnetAnthropic6.5
166GPT 4oOpenAI6.3
167Qwen TurboAlibaba6.1
168Mistral Small 3Mistral6.0
169Llama 3.3 70BMeta5.1
170Mistral Small 3.1Mistral4.9
171Claude 3 OpusAnthropic4.7
172Gemini 1.5 Flash 8BGoogle4.6
173Tülu 3 70BAi24.4
174Claude 3.5 HaikuAnthropic4.3
175Llama 3-70BMeta4.3
176Llama 3.1-70BMeta3.6
177granite-4.0-micro2.8
178Llama 3.2 90BMeta2.6
179Claude 2Anthropic2.5
180Claude 3 SonnetAnthropic2.5
181Hermes 2 Theta Llama-3 70BNous Research2.5
182Qwen2.5-7BAlibaba2.5
183GPT-3.5 TurboOpenAI2.2
184Claude 2.1Anthropic1.9
185Llama 3-8BMeta1.9
186Mistral LargeMistral1.9
187Claude 3 HaikuAnthropic1.8
188Llama 3.1-8BMeta1.7
189Gemma 2 27BGoogle1.4
190Gemini 1.0 ProGoogle1.1
191Gemma 3 1BGoogle1.1
192GPT-4OpenAI1.1
193DeepSeek LLM 67BDeepSeek0.8
194granite-4.0-1b0.8
195Gemma 2 9BGoogle0.6
196GPT-4OpenAI0.6
197Llama 3.2 1BMeta0.6
198granite-4.0-350m0.3
199Mistral 7BMistral0.3
200Llama 2-70BMeta0.0

The benchmark's own page