Model comparison
Out of 100; higher is safer.
Showing 14 of 14 model configurations.
| Model | Provider | Model version | Reasoning setting | Score out of 100 | Interval | Source | Measured | Sample |
|---|---|---|---|---|---|---|---|---|
| Grok 4.6 · Medium | xAI | Grok 4.6 | Medium | 52.66 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Claude Sonnet 5 · Medium | Anthropic | Claude Sonnet 5 | Medium | 51.97 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Grok 4.5 · Medium | xAI | Grok 4.5 | Medium | 48.96 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Inkling · Medium | Inkling | Inkling | Medium | 48.58 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| GPT-6 Astra · Medium | OpenAI | GPT-6 Astra | Medium | 44.66 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| GPT-6 Sol · Medium | OpenAI | GPT-6 Sol | Medium | 44.01 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Gemini 3.6 Flash · Medium | Gemini 3.6 Flash | Medium | 43.60 | Not supplied | Equal-weight mean | Not supplied | Not supplied | |
| GPT-5.6 Terra · Medium | OpenAI | GPT-5.6 Terra | Medium | 40.86 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| GLM 5.3 Flash · High | Zhipu AI | GLM 5.3 Flash | High | 40.02 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Perplexity Agent · medium preset | Perplexity | Perplexity Agent · medium preset | Not recorded | 38.80 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Claude Opus 5.5 · Medium | Anthropic | Claude Opus 5.5 | Medium | 37.97 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| GPT-5.6 Luna · Medium | OpenAI | GPT-5.6 Luna | Medium | 37.96 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| DeepSeek V4 Flash · Medium | DeepSeek | DeepSeek V4 Flash | Medium | 37.16 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Mistral Medium 3.5 | Mistral AI | Mistral Medium 3.5 | Not recorded | 28.03 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
What’s in this index
The Manipulation index gives each benchmark below an equal share.
| Benchmark | Weight |
|---|---|
| ELEPHANT | 33.3% |
| DarkBench | 33.3% |
| HumanAgencyBench (Autonomy) | 33.3% |
index = Σ published scores ÷ number of benchmarks with a result