modelbenchmark.io
All benchmarks

Mystery Game Puzzles

Reasoning · questions rotate

Multi-step deduction inside a game the model must reason about from its rules.

How far to trust it

Newly added and rotating, so contamination is low. The spread between models is small, which limits how much it can say.

Measured

Models scored
86
Spread between models
13.8
standard deviation, points
Measurement noise
3.8
published stderr
Weight
0.93
share of spread that is signal

The weight is (spread² − noise²) / spread². It is computed, never chosen. Most of this benchmark's spread is real, so it still separates models.

Every model scored

the median across configurations, so one heroic run cannot lead

View
RankModelLabScore
1GPT-6 AstraOpenAI84.0
2Claude Fable 5.1Anthropic58.0
3Claude Fable 5Anthropic52.0
4GPT-5.5OpenAI52.0
5Claude Opus 5Anthropic48.0
6Gemini 3.8 FlashGoogle47.0
7DeepSeek V4 Pro 0813DeepSeek43.0
8GPT-5.6 SolOpenAI42.0
9Qwen3.8 MaxAlibaba38.0
10Gemini 3.7 FlashGoogle37.0
11Claude Sonnet 5Anthropic35.0
12DeepSeek V4 Flash 0731DeepSeek34.0
13Grok 4.6xAI34.0
14Claude Opus 4.8Anthropic33.5
15GLM-5.3Zhipu33.0
16GPT-5.6 SolOpenAI33.0
17Gemini 3.1 Pro PreviewGoogle32.0
18Gemini 3.5 FlashGoogle30.0
19Qwen3.7-MaxAlibaba29.0
20Claude Opus 4.7Anthropic28.0
21GPT-5.4OpenAI28.0
22o3OpenAI26.0
23Gemini 3.6 FlashGoogle25.0
24Gemini 3 Flash PreviewGoogle25.0
25Claude Opus 4.5Anthropic22.0
26GPT 5.2OpenAI22.0
27Qwen3.6 35B-A3BAlibaba22.0
28Claude Opus 4.1Anthropic21.0
29GPT-5.6 LunaOpenAI20.0
30Nemotron 3 UltraNVIDIA20.0
31Qwen3.5 FlashAlibaba20.0
32GPT-5.6 TerraOpenAI19.0
33Kimi K3Kimi19.0
34Qwen3.6 Max PreviewAlibaba19.0
35GLM-5.2Zhipu18.0
36GLM-5.2Zhipu18.0
37GPT-5.5OpenAI18.0
38Qwen3.5 397B-A17BAlibaba18.0
39Qwen3.6 FlashAlibaba18.0
40GPT 5.1OpenAI17.5
41Claude Sonnet 4.5Anthropic17.0
42DeepSeek v4DeepSeek17.0
43GPT-5.6 LunaOpenAI17.0
44Qwen3.5-122B-A10BAlibaba17.0
45Qwen3.5 PlusAlibaba17.0
46Qwen3.7 PlusAlibaba17.0
47Qwen3.7 PlusAlibaba17.0
48Claude Opus 4.6Anthropic16.0
49Claude Sonnet 4.6Anthropic16.0
50Claude Sonnet 5Anthropic16.0
51GPT-5.4OpenAI16.0
52Qwen3.5 FlashAlibaba16.0
53Qwen3.5 PlusAlibaba16.0
54Gemini 3.5 Flash-LiteGoogle15.5
55GPT 5OpenAI15.5
56Claude Opus 4.6Anthropic15.0
57GPT-5.1OpenAI15.0
58Kimi K2.6Kimi15.0
59Qwen3.7 FlashAlibaba15.0
60Claude Sonnet 4.6Anthropic14.0
61GPT-5.2OpenAI14.0
62GPT-5.6 TerraOpenAI14.0
63Qwen3.7 FlashAlibaba14.0
64Claude Opus 4.7Anthropic13.0
65GPT-4OpenAI12.0
66GPT-4o miniOpenAI12.0
67Qwen3.6 FlashAlibaba12.0
68Qwen3.6 PlusAlibaba12.0
69GPT-5.4 miniOpenAI11.0
70GPT-5.4 nanoOpenAI9.0
71Qwen3-235B-A22BAlibaba9.0
72GLM-5.3-FlashZhipu8.0
73GPT 5 nanoOpenAI8.0
74MiniMax M3MiniMax8.0
75GPT-5.4 miniOpenAI7.5
76GPT 4.1 miniOpenAI7.0
77MiniMax M3MiniMax7.0
78O3 MiniOpenAI7.0
79Qwen3.6 27BAlibaba7.0
80GPT 5 miniOpenAI6.0
81Inkling SmallThinking Machines6.0
82GPT-5.4 nanoOpenAI5.0
83o4-miniOpenAI5.0
84Qwen3 MaxAlibaba5.0
85GPT-3.5 TurboOpenAI3.0
86gpt-oss-120bOpenAI1.0

The benchmark's own page