Model comparison
Out of 100; higher is safer.
Showing 14 of 14 model configurations.
| Model | Provider | Model version | Reasoning setting | Score out of 100 | Interval | Source | Measured | Sample |
|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5 · Medium | Anthropic | Claude Sonnet 5 | Medium | 72.14 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Gemini 3.6 Flash · Medium | Gemini 3.6 Flash | Medium | 67.61 | Not supplied | Equal-weight mean | Not supplied | Not supplied | |
| Inkling · Medium | Inkling | Inkling | Medium | 66.66 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| GLM 5.3 Flash · High | Zhipu AI | GLM 5.3 Flash | High | 66.66 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Perplexity Agent · medium preset | Perplexity | Perplexity Agent · medium preset | Not recorded | 62.38 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| GPT-5.6 Terra · Medium | OpenAI | GPT-5.6 Terra | Medium | 58.33 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| GPT-6 Sol · Medium | OpenAI | GPT-6 Sol | Medium | 57.85 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Claude Opus 5.5 · Medium | Anthropic | Claude Opus 5.5 | Medium | 57.61 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Grok 4.6 · Medium | xAI | Grok 4.6 | Medium | 57.61 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| DeepSeek V4 Flash · Medium | DeepSeek | DeepSeek V4 Flash | Medium | 56.19 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| GPT-5.6 Luna · Medium | OpenAI | GPT-5.6 Luna | Medium | 54.76 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| GPT-6 Astra · Medium | OpenAI | GPT-6 Astra | Medium | 52.38 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Grok 4.5 · Medium | xAI | Grok 4.5 | Medium | 51.19 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Mistral Medium 3.5 | Mistral AI | Mistral Medium 3.5 | Not recorded | 29.28 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
What’s in this index
The Security index gives each benchmark below an equal share.
| Benchmark | Weight |
|---|---|
| ASK — AI Scam Knowledge | 100% |
index = Σ published scores ÷ number of benchmarks with a result