Model comparison
Out of 100; higher is safer.
Showing 14 of 14 model configurations.
| Model | Provider | Model version | Reasoning setting | Score out of 100 | Interval | Source | Measured | Sample |
|---|---|---|---|---|---|---|---|---|
| Perplexity Agent · medium preset | Perplexity | Perplexity Agent · medium preset | Not recorded | 91.15 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Claude Opus 5.5 · Medium | Anthropic | Claude Opus 5.5 | Medium | 85.67 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| GPT-6 Astra · Medium | OpenAI | GPT-6 Astra | Medium | 84.81 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| GPT-6 Sol · Medium | OpenAI | GPT-6 Sol | Medium | 77.76 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Grok 4.6 · Medium | xAI | Grok 4.6 | Medium | 74.04 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Grok 4.5 · Medium | xAI | Grok 4.5 | Medium | 72.74 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| GPT-5.6 Terra · Medium | OpenAI | GPT-5.6 Terra | Medium | 71.47 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Gemini 3.6 Flash · Medium | Gemini 3.6 Flash | Medium | 70.62 | Not supplied | Equal-weight mean | Not supplied | Not supplied | |
| GLM 5.3 Flash · High | Zhipu AI | GLM 5.3 Flash | High | 70.52 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Inkling · Medium | Inkling | Inkling | Medium | 66.40 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Claude Sonnet 5 · Medium | Anthropic | Claude Sonnet 5 | Medium | 64.87 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| DeepSeek V4 Flash · Medium | DeepSeek | DeepSeek V4 Flash | Medium | 64.05 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| GPT-5.6 Luna · Medium | OpenAI | GPT-5.6 Luna | Medium | 63.94 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Mistral Medium 3.5 | Mistral AI | Mistral Medium 3.5 | Not recorded | 39.37 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
What’s in this index
The Misinformation index gives each benchmark below an equal share.
| Benchmark | Weight |
|---|---|
| SimpleQA Verified | 33.3% |
| SYCON-Bench | 33.3% |
| HumanAgencyBench (Correct Misinformation) | 33.3% |
index = Σ published scores ÷ number of benchmarks with a result