SimpleQA Verified
Knowledge · fixed question set
Short factual questions with one verifiable answer.
How far to trust it
Measures recall and the willingness to say 'I do not know'. A model that guesses confidently scores worse here than one that declines, which is the opposite of most benchmarks.
Measured
Models scored
72
Spread between models
18.1
standard deviation, points
Measurement noise
1.5
published stderr
Weight
0.99
share of spread that is signal
The weight is (spread² − noise²) / spread². It is computed, never chosen. Most of this benchmark's spread is real, so it still separates models.
Every model scored
the median across configurations, so one heroic run cannot lead
| Rank | Model | Lab | Score |
|---|---|---|---|
| 1 | GPT-6 Astra | OpenAI | 75.6 |
| 2 | Gemini 3.1 Pro Preview | 73.5 | |
| 3 | Claude Fable 5.1 | Anthropic | 70.8 |
| 4 | Claude Fable 5 | Anthropic | 70.7 |
| 5 | Gemini 3.8 Flash | 69.7 | |
| 6 | GPT-5.6 Sol | OpenAI | 69.7 |
| 7 | Gemini 3.7 Flash | 69.2 | |
| 8 | Gemini 3 Flash Preview | 66.8 | |
| 9 | Gemini 3.5 Flash | 66.2 | |
| 10 | Gemini 3.6 Flash | 66.2 | |
| 11 | GPT-5.5 | OpenAI | 63.0 |
| 12 | Muse Spark 1.2 | Meta | 60.3 |
| 13 | Claude Opus 5 | Anthropic | 59.9 |
| 14 | Muse Spark 1.1 | Meta | 57.8 |
| 15 | Qwen3.7-Max | Alibaba | 55.8 |
| 16 | Claude Opus 4.8 | Anthropic | 53.0 |
| 17 | DeepSeek V4 Pro 0813 | DeepSeek | 52.9 |
| 18 | Qwen3.6 Max Preview | Alibaba | 52.0 |
| 19 | Claude Opus 4.7 | Anthropic | 51.7 |
| 20 | Kimi K3 | Kimi | 50.6 |
| 21 | GPT 5 | OpenAI | 50.1 |
| 22 | o3 | OpenAI | 49.4 |
| 23 | Grok 4.6 | xAI | 49.1 |
| 24 | Qwen3 Max | Alibaba | 48.8 |
| 25 | Grok 4.5 | xAI | 48.3 |
| 26 | GPT 5.1 | OpenAI | 48.0 |
| 27 | Qwen3.8 Max (0902) | Alibaba | 47.3 |
| 28 | Claude Opus 4.6 | Anthropic | 47.0 |
| 29 | DeepSeek v4 | DeepSeek | 47.0 |
| 30 | GPT-5.4 Pro | OpenAI | 46.3 |
| 31 | Qwen3.8 Max | Alibaba | 45.8 |
| 32 | Claude Opus 4.5 | Anthropic | 45.7 |
| 33 | GPT-5.4 | OpenAI | 45.1 |
| 34 | Qwen3.6 Plus | Alibaba | 44.1 |
| 35 | GPT-5.6 Terra | OpenAI | 43.2 |
| 36 | o1-2024-12-17 | OpenAI | 41.1 |
| 37 | GLM-5.3 | Zhipu | 41.0 |
| 38 | GPT-5.6 Luna | OpenAI | 41.0 |
| 39 | Qwen3-235B-A22B | Alibaba | 40.4 |
| 40 | Inkling | Thinking Machines | 40.3 |
| 41 | Kimi K2.7 Code | Kimi | 36.5 |
| 42 | Kimi K2.6 | Kimi | 34.9 |
| 43 | Kimi K2.5 | Kimi | 34.3 |
| 44 | GLM-5.2 | Zhipu | 34.2 |
| 45 | Claude Sonnet 4.6 | Anthropic | 34.1 |
| 46 | GLM-5.1 | Zhipu | 34.0 |
| 47 | DeepSeek V4 Flash 0731 | DeepSeek | 33.6 |
| 48 | GPT 5.2 | OpenAI | 33.5 |
| 49 | Claude Sonnet 5 | Anthropic | 33.3 |
| 50 | Grok 4.3 Beta | xAI | 33.2 |
| 51 | GLM-4.7 | Zhipu | 32.2 |
| 52 | GPT 4.1 | OpenAI | 31.1 |
| 53 | Claude Sonnet 4.5 | Anthropic | 30.7 |
| 54 | Grok 4.20 | xAI | 30.2 |
| 55 | GPT-5.4 mini | OpenAI | 29.4 |
| 56 | GPT 4o | OpenAI | 26.0 |
| 57 | Qwen3.5 Plus | Alibaba | 25.4 |
| 58 | Claude Sonnet 4.5 | Anthropic | 23.7 |
| 59 | GPT 5 mini | OpenAI | 21.6 |
| 60 | Qwen3.5 Flash | Alibaba | 20.3 |
| 61 | o4-mini | OpenAI | 19.2 |
| 62 | Inkling Small | Thinking Machines | 19.1 |
| 63 | Qwen3.6 Flash | Alibaba | 15.9 |
| 64 | O3 Mini | OpenAI | 15.3 |
| 65 | Claude Haiku 4.5 | Anthropic | 12.9 |
| 66 | GPT 4.1 mini | OpenAI | 12.7 |
| 67 | Claude 3 Opus | Anthropic | 12.6 |
| 68 | GPT-5.4 nano | OpenAI | 11.7 |
| 69 | GPT 5 nano | OpenAI | 11.7 |
| 70 | Gemma 4 31B IT | 10.4 | |
| 71 | GPT-4o mini | OpenAI | 8.3 |
| 72 | GPT-4.1 nano | OpenAI | 6.0 |