Model comparison
Out of 100; higher is safer.
Showing 14 of 14 model configurations.
| Model | Provider | Model version | Reasoning setting | Score out of 100 | Interval | Source | Measured | Sample |
|---|---|---|---|---|---|---|---|---|
| Gemini 3.6 Flash · Medium | Gemini 3.6 Flash | Medium | 78.08 | Not supplied | Equal-weight mean | Not supplied | Not supplied | |
| Claude Opus 5.5 · Medium | Anthropic | Claude Opus 5.5 | Medium | 72.73 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Grok 4.5 · Medium | xAI | Grok 4.5 | Medium | 71.93 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Inkling · Medium | Inkling | Inkling | Medium | 71.60 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| GPT-6 Sol · Medium | OpenAI | GPT-6 Sol | Medium | 70.79 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| GPT-6 Astra · Medium | OpenAI | GPT-6 Astra | Medium | 70.07 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| GPT-5.6 Terra · Medium | OpenAI | GPT-5.6 Terra | Medium | 69.88 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Grok 4.6 · Medium | xAI | Grok 4.6 | Medium | 69.66 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| GLM 5.3 Flash · High | Zhipu AI | GLM 5.3 Flash | High | 68.07 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| DeepSeek V4 Flash · Medium | DeepSeek | DeepSeek V4 Flash | Medium | 67.33 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| GPT-5.6 Luna · Medium | OpenAI | GPT-5.6 Luna | Medium | 67.07 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Claude Sonnet 5 · Medium | Anthropic | Claude Sonnet 5 | Medium | 66.59 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Mistral Medium 3.5 | Mistral AI | Mistral Medium 3.5 | Not recorded | 66.11 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
| Perplexity Agent · medium preset | Perplexity | Perplexity Agent · medium preset | Not recorded | 62.07 | Not supplied | Equal-weight mean | Not supplied | Not supplied |
What’s in this index
The Rule Following index gives each benchmark below an equal share.
| Benchmark | Weight |
|---|---|
| SystemCheck / RealGuardrails | 50% |
| AgentIF | 50% |
index = Σ published scores ÷ number of benchmarks with a result