Mystery Game Puzzles
Reasoning · questions rotate
Multi-step deduction inside a game the model must reason about from its rules.
How far to trust it
Newly added and rotating, so contamination is low. The spread between models is small, which limits how much it can say.
Measured
Models scored
86
Spread between models
13.8
standard deviation, points
Measurement noise
3.8
published stderr
Weight
0.93
share of spread that is signal
The weight is (spread² − noise²) / spread². It is computed, never chosen. Most of this benchmark's spread is real, so it still separates models.
Every model scored
the median across configurations, so one heroic run cannot lead
| Rank | Model | Lab | Score |
|---|---|---|---|
| 1 | GPT-6 Astra | OpenAI | 84.0 |
| 2 | Claude Fable 5.1 | Anthropic | 58.0 |
| 3 | Claude Fable 5 | Anthropic | 52.0 |
| 4 | GPT-5.5 | OpenAI | 52.0 |
| 5 | Claude Opus 5 | Anthropic | 48.0 |
| 6 | Gemini 3.8 Flash | 47.0 | |
| 7 | DeepSeek V4 Pro 0813 | DeepSeek | 43.0 |
| 8 | GPT-5.6 Sol | OpenAI | 42.0 |
| 9 | Qwen3.8 Max | Alibaba | 38.0 |
| 10 | Gemini 3.7 Flash | 37.0 | |
| 11 | Claude Sonnet 5 | Anthropic | 35.0 |
| 12 | DeepSeek V4 Flash 0731 | DeepSeek | 34.0 |
| 13 | Grok 4.6 | xAI | 34.0 |
| 14 | Claude Opus 4.8 | Anthropic | 33.5 |
| 15 | GLM-5.3 | Zhipu | 33.0 |
| 16 | GPT-5.6 Sol | OpenAI | 33.0 |
| 17 | Gemini 3.1 Pro Preview | 32.0 | |
| 18 | Gemini 3.5 Flash | 30.0 | |
| 19 | Qwen3.7-Max | Alibaba | 29.0 |
| 20 | Claude Opus 4.7 | Anthropic | 28.0 |
| 21 | GPT-5.4 | OpenAI | 28.0 |
| 22 | o3 | OpenAI | 26.0 |
| 23 | Gemini 3.6 Flash | 25.0 | |
| 24 | Gemini 3 Flash Preview | 25.0 | |
| 25 | Claude Opus 4.5 | Anthropic | 22.0 |
| 26 | GPT 5.2 | OpenAI | 22.0 |
| 27 | Qwen3.6 35B-A3B | Alibaba | 22.0 |
| 28 | Claude Opus 4.1 | Anthropic | 21.0 |
| 29 | GPT-5.6 Luna | OpenAI | 20.0 |
| 30 | Nemotron 3 Ultra | NVIDIA | 20.0 |
| 31 | Qwen3.5 Flash | Alibaba | 20.0 |
| 32 | GPT-5.6 Terra | OpenAI | 19.0 |
| 33 | Kimi K3 | Kimi | 19.0 |
| 34 | Qwen3.6 Max Preview | Alibaba | 19.0 |
| 35 | GLM-5.2 | Zhipu | 18.0 |
| 36 | GLM-5.2 | Zhipu | 18.0 |
| 37 | GPT-5.5 | OpenAI | 18.0 |
| 38 | Qwen3.5 397B-A17B | Alibaba | 18.0 |
| 39 | Qwen3.6 Flash | Alibaba | 18.0 |
| 40 | GPT 5.1 | OpenAI | 17.5 |
| 41 | Claude Sonnet 4.5 | Anthropic | 17.0 |
| 42 | DeepSeek v4 | DeepSeek | 17.0 |
| 43 | GPT-5.6 Luna | OpenAI | 17.0 |
| 44 | Qwen3.5-122B-A10B | Alibaba | 17.0 |
| 45 | Qwen3.5 Plus | Alibaba | 17.0 |
| 46 | Qwen3.7 Plus | Alibaba | 17.0 |
| 47 | Qwen3.7 Plus | Alibaba | 17.0 |
| 48 | Claude Opus 4.6 | Anthropic | 16.0 |
| 49 | Claude Sonnet 4.6 | Anthropic | 16.0 |
| 50 | Claude Sonnet 5 | Anthropic | 16.0 |
| 51 | GPT-5.4 | OpenAI | 16.0 |
| 52 | Qwen3.5 Flash | Alibaba | 16.0 |
| 53 | Qwen3.5 Plus | Alibaba | 16.0 |
| 54 | Gemini 3.5 Flash-Lite | 15.5 | |
| 55 | GPT 5 | OpenAI | 15.5 |
| 56 | Claude Opus 4.6 | Anthropic | 15.0 |
| 57 | GPT-5.1 | OpenAI | 15.0 |
| 58 | Kimi K2.6 | Kimi | 15.0 |
| 59 | Qwen3.7 Flash | Alibaba | 15.0 |
| 60 | Claude Sonnet 4.6 | Anthropic | 14.0 |
| 61 | GPT-5.2 | OpenAI | 14.0 |
| 62 | GPT-5.6 Terra | OpenAI | 14.0 |
| 63 | Qwen3.7 Flash | Alibaba | 14.0 |
| 64 | Claude Opus 4.7 | Anthropic | 13.0 |
| 65 | GPT-4 | OpenAI | 12.0 |
| 66 | GPT-4o mini | OpenAI | 12.0 |
| 67 | Qwen3.6 Flash | Alibaba | 12.0 |
| 68 | Qwen3.6 Plus | Alibaba | 12.0 |
| 69 | GPT-5.4 mini | OpenAI | 11.0 |
| 70 | GPT-5.4 nano | OpenAI | 9.0 |
| 71 | Qwen3-235B-A22B | Alibaba | 9.0 |
| 72 | GLM-5.3-Flash | Zhipu | 8.0 |
| 73 | GPT 5 nano | OpenAI | 8.0 |
| 74 | MiniMax M3 | MiniMax | 8.0 |
| 75 | GPT-5.4 mini | OpenAI | 7.5 |
| 76 | GPT 4.1 mini | OpenAI | 7.0 |
| 77 | MiniMax M3 | MiniMax | 7.0 |
| 78 | O3 Mini | OpenAI | 7.0 |
| 79 | Qwen3.6 27B | Alibaba | 7.0 |
| 80 | GPT 5 mini | OpenAI | 6.0 |
| 81 | Inkling Small | Thinking Machines | 6.0 |
| 82 | GPT-5.4 nano | OpenAI | 5.0 |
| 83 | o4-mini | OpenAI | 5.0 |
| 84 | Qwen3 Max | Alibaba | 5.0 |
| 85 | GPT-3.5 Turbo | OpenAI | 3.0 |
| 86 | gpt-oss-120b | OpenAI | 1.0 |