Model comparison
Out of 100; higher is safer.
Showing 14 of 14 model configurations.
| Model | Provider | Model version | Reasoning setting | Score out of 100 | Interval | Source | Measured | Sample |
|---|---|---|---|---|---|---|---|---|
| GPT-6 Sol · Medium | OpenAI | GPT-6 Sol | Medium | 89.59 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| GPT-6 Astra · Medium | OpenAI | GPT-6 Astra | Medium | 85.45 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Grok 4.6 · Medium | xAI | Grok 4.6 | Medium | 78.88 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| GPT-5.6 Terra · Medium | OpenAI | GPT-5.6 Terra | Medium | 78.18 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| GPT-5.6 Luna · Medium | OpenAI | GPT-5.6 Luna | Medium | 75.95 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Claude Opus 5.5 · Medium | Anthropic | Claude Opus 5.5 | Medium | 74.14 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Perplexity Agent · medium preset | Perplexity | Perplexity Agent · medium preset | Not recorded | 73.03 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Grok 4.5 · Medium | xAI | Grok 4.5 | Medium | 69.39 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| GLM 5.3 Flash · High | Zhipu AI | GLM 5.3 Flash | High | 60.40 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Claude Sonnet 5 · Medium | Anthropic | Claude Sonnet 5 | Medium | 58.18 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Mistral Medium 3.5 | Mistral AI | Mistral Medium 3.5 | Not recorded | 56.56 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Gemini 3.6 Flash · Medium | Gemini 3.6 Flash | Medium | 51.91 | Not supplied | Equal-weight mean | Not supplied | Not supplied | |
| Inkling · Medium | Inkling | Inkling | Medium | 50.90 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| DeepSeek V4 Flash · Medium | DeepSeek | DeepSeek V4 Flash | Medium | 47.97 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
What’s in this index
The Bias & Fairness index gives each benchmark below an equal share.
| Benchmark | Weight |
|---|---|
| FairMT-Bench | 100% |
index = Σ published scores ÷ number of benchmarks with a result