EBR-bench
Reasoning · fixed question set
Evidence-based reasoning tasks.
How far to trust it
Only 19 models are measured, so most models cannot be placed on it at all. Its weight is real but its coverage is thin.
Measured
Models scored
21
Spread between models
19.0
standard deviation, points
Measurement noise
2.8
published stderr
Weight
0.98
share of spread that is signal
The weight is (spread² − noise²) / spread². It is computed, never chosen. Most of this benchmark's spread is real, so it still separates models.
Every model scored
the median across configurations, so one heroic run cannot lead
| Rank | Model | Lab | Score |
|---|---|---|---|
| 1 | GPT-6 Astra | OpenAI | 76.2 |
| 2 | Claude Fable 5.1 | Anthropic | 57.1 |
| 3 | Claude Opus 5 | Anthropic | 45.7 |
| 4 | GPT-5.6 Sol | OpenAI | 44.8 |
| 5 | Claude Fable 5 | Anthropic | 39.5 |
| 6 | GPT-5.5 | OpenAI | 34.3 |
| 7 | Grok 4.6 | xAI | 30.5 |
| 8 | Claude Opus 4.8 | Anthropic | 28.6 |
| 9 | GPT-5.4 | OpenAI | 25.4 |
| 10 | GPT 5.2 | OpenAI | 23.0 |
| 11 | Claude Opus 4.7 | Anthropic | 19.1 |
| 12 | Claude Opus 4.5 | Anthropic | 14.3 |
| 13 | Gemini 3.1 Pro Preview | 14.3 | |
| 14 | Claude Opus 4.6 | Anthropic | 12.7 |
| 15 | GPT 5 | OpenAI | 12.7 |
| 16 | GLM-5.2 | Zhipu | 9.5 |
| 17 | Qwen3.7-Max | Alibaba | 9.5 |
| 18 | Claude Opus 4.1 | Anthropic | 7.9 |
| 19 | Gemini 3.5 Flash | 4.8 | |
| 20 | Claude Sonnet 4.5 | Anthropic | 2.4 |
| 21 | Kimi K2.6 | Kimi | 2.4 |