modelbenchmark.io
All benchmarks

Chess Puzzles

Reasoning · questions rotate

Tactical chess positions with one correct continuation.

How far to trust it

A narrow skill, and not one most buyers need. It is in the composite because it discriminates well, not because it is representative.

Measured

Models scored
157
Spread between models
15.8
standard deviation, points
Measurement noise
3.8
published stderr
Weight
0.94
share of spread that is signal

The weight is (spread² − noise²) / spread². It is computed, never chosen. Most of this benchmark's spread is real, so it still separates models.

Every model scored

the median across configurations, so one heroic run cannot lead

View
RankModelLabScore
1GPT-6 AstraOpenAI72.0
2GPT-5.5 Pro pre-releaseOpenAI64.0
3GPT-5.6 SolOpenAI64.0
4Gemini 3.8 FlashGoogle61.0
5GPT-5.4 ProOpenAI58.6
6Gemini 3.1 Pro PreviewGoogle52.0
7Claude Fable 5.1Anthropic47.0
8DeepSeek V4 Pro 0813DeepSeek47.0
9Gemini 3.7 FlashGoogle47.0
10Gemini 3.5 FlashGoogle45.0
11Claude Fable 5Anthropic41.0
12GPT-5.6 SolOpenAI41.0
13Gemini 3.6 FlashGoogle40.0
14GPT 5.2OpenAI40.0
15GPT-5.5OpenAI40.0
16Qwen3.8 Max (0902)Alibaba40.0
17Gemini 3 Flash PreviewGoogle39.0
18GPT-5.4OpenAI38.0
19GPT-5.6 TerraOpenAI38.0
20Grok 4.5xAI36.0
21Grok 4.6xAI35.5
22Claude Opus 5Anthropic33.0
23DeepSeek V4 Flash 0731DeepSeek33.0
24o3OpenAI33.0
25Claude Opus 4.8Anthropic31.5
26Gemini 3 Pro PreviewGoogle31.0
27GPT-5.6 LunaOpenAI30.5
28Qwen3.8 MaxAlibaba29.0
29Grok 4xAI28.0
30GPT 5OpenAI26.5
31Kimi K2.6Kimi26.0
32Qwen3.6 35B-A3BAlibaba26.0
33Claude Sonnet 5Anthropic25.5
34Grok 4.3 BetaxAI25.0
35Kimi K3Kimi25.0
36Gemini 3.1 Flash-LiteGoogle24.0
37Grok 4.20xAI24.0
38Qwen3.7 PlusAlibaba24.0
39GPT-5.4 nanoOpenAI23.5
40GPT 5.1OpenAI23.0
41Qwen3.7 FlashAlibaba23.0
42Qwen3.5 PlusAlibaba22.0
43Qwen3.6 27BAlibaba22.0
44Gemini 3.5 Flash-LiteGoogle21.0
45GLM-5.3Zhipu21.0
46GPT-5.4 miniOpenAI21.0
47InklingThinking Machines21.0
48Kimi K2.7 CodeKimi21.0
49Qwen3.5 FlashAlibaba21.0
50Claude Opus 4.7Anthropic20.0
51Gemini 2.5 ProGoogle20.0
52gpt-oss-120bOpenAI20.0
53Kimi K2 InstructKimi20.0
54o4-miniOpenAI20.0
55Qwen3.6 Max PreviewAlibaba20.0
56Qwen3.6 FlashAlibaba20.0
57GPT 5 miniOpenAI19.8
58GLM-5.1Zhipu19.0
59Qwen3.7-MaxAlibaba19.0
60Inkling SmallThinking Machines18.0
61GLM-5.2Zhipu17.5
62GPT 5 nanoOpenAI17.5
63GPT-5.1OpenAI17.0
64Qwen3.6 PlusAlibaba17.0
65DeepSeek v4DeepSeek16.5
66GLM-5.3-FlashZhipu14.0
67MiniMax M3MiniMax14.0
68Claude Opus 4.6Anthropic13.5
69Claude Opus 4.8Anthropic13.0
70GPT 4oOpenAI13.0
71Qwen3.5 397B-A17BAlibaba13.0
72seed-oss-36b-instruct13.0
73Claude Opus 4.5Anthropic12.0
74Claude Sonnet 4.5Anthropic12.0
75GPT-5.5 InstantOpenAI12.0
76Kimi K2.5Kimi12.0
77Nemotron 3 UltraNVIDIA12.0
78Qwen3-235B-A22BAlibaba12.0
79Qwen3.5 397B-A17BAlibaba12.0
80Qwen3.5 9BAlibaba12.0
81o1-2024-12-17OpenAI11.3
82O3 MiniOpenAI10.7
83GLM 5Zhipu10.0
84GPT-5.5OpenAI10.0
85Qwen3.6 27BAlibaba9.0
86Qwen3.7 FlashAlibaba9.0
87Qwen3.7 PlusAlibaba9.0
88Claude Haiku 4.5Anthropic8.0
89DeepSeek-V3.2-ExpDeepSeek7.5
90Claude Opus 4.1Anthropic7.0
91DeepSeek v4DeepSeek7.0
92GPT 4.1 miniOpenAI7.0
93GPT-5.6 SolOpenAI7.0
94Claude Sonnet 4.6Anthropic6.5
95Gemma 4 26B-A4B ITGoogle6.0
96GLM-4.7Zhipu6.0
97GLM-5.2Zhipu6.0
98GPT 4.1OpenAI6.0
99GPT-4 TurboOpenAI6.0
100Qwen3.5-35B-A3BAlibaba5.5
101Claude 3 OpusAnthropic5.0
102Gemma 4 31B ITGoogle5.0
103GPT-5.4OpenAI5.0
104GPT-5.6 TerraOpenAI5.0
105Qwen3-30B-A3BAlibaba5.0
106Qwen3 8BAlibaba5.0
107QwQ 32BAlibaba5.0
108Claude Opus 4.5Anthropic4.0
109Claude Sonnet 4.5Anthropic4.0
110GPT-4OpenAI4.0
111GPT-5.2OpenAI4.0
112MiniMax M3MiniMax4.0
113Qwen3 MaxAlibaba4.0
114qwen3-4b-instruct-25074.0
115Qwen3.6 35B-A3BAlibaba4.0
116DeepSeek-R1-05283.0
117GPT-5.4 miniOpenAI3.0
118GPT-5.4 nanoOpenAI3.0
119Magistral Small 1.2Mistral3.0
120Qwen3 32BAlibaba3.0
121Qwen3-30B-A3BAlibaba2.5
122GPT-5.6 LunaOpenAI2.0
123gpt-oss-20bOpenAI2.0
124Qwen3-14BAlibaba2.0
125Qwen3.5 9BAlibaba2.0
126DeepSeek-R1-Distill-Qwen-14BDeepSeek1.0
127DeepSeek-R1-Distill-Qwen-32BDeepSeek1.0
128Mistral Small 3.1Mistral1.0
129Mistral Small 3.2Mistral1.0
130Phi-4Microsoft1.0
131Qwen3-4BAlibaba1.0
132DeepSeek LLM 67BDeepSeek0.0
133DeepSeek-R1-Distill-Qwen-1.5BDeepSeek0.0
134Gemma 3 12BGoogle0.0
135Gemma 3 1BGoogle0.0
136Gemma 3 27BGoogle0.0
137Gemma 3 4BGoogle0.0
138glm-4.7-flash0.0
139glm-4.7-flash_none0.0
140GPT-3.5 TurboOpenAI0.0
141GPT-4o miniOpenAI0.0
142granite-4.0-1b0.0
143granite-4.0-350m0.0
144granite-4.0-micro0.0
145Llama 2-13BMeta0.0
146Llama 2-7BMeta0.0
147Llama 3.1-8BMeta0.0
148Llama 3.2 1BMeta0.0
149Llama 3-8BMeta0.0
150Mistral 7BMistral0.0
151Mistral Small 3Mistral0.0
152phi-3-mini 3.8BMicrosoft0.0
153Qwen2.5-32BAlibaba0.0
154Qwen2.5-7BAlibaba0.0
155Qwen3-1.7BAlibaba0.0
156Qwen3.5-2BAlibaba0.0
157Qwen3 8BAlibaba0.0

The benchmark's own page