A task with its own rules.
An independently evaluated professional-work benchmark reported as Elo.
- Organisation
- Artificial Analysis
- Version
- 2026
Agents / Benchmark profile
An independently evaluated professional-work benchmark reported as Elo.
Observed results
20 ranked models · higher is better · labels show rank and score
| Model | Rank | Model ID | Provider | Score | Unit |
|---|---|---|---|---|---|
| Claude Opus 5 | #1 | claude-opus-5 | Anthropic | 1720 | elo |
| Grok 4.6 | #2 | grok-4-6 | xAI | 1577 | elo |
| Claude Fable 5 | #3 | claude-fable-5 | Anthropic | 1574 | elo |
| Kimi K3 | #4 | kimi-k3 | Moonshot AI | 1543 | elo |
| GPT-5.6 Sol | #5 | gpt-5-6-sol | OpenAI | 1505 | elo |
| Claude Sonnet 5 | #6 | claude-sonnet-5 | Anthropic | 1388 | elo |
| Claude Opus 4.8 | #7 | claude-opus-4-8 | Anthropic | 1347 | elo |
| Grok 4.5 | #8 | grok-4-5 | xAI | 1323 | elo |
| GLM-5.2 | #9 | glm-5-2 | Z.AI | 1260 | elo |
| GPT-5.5 | #10 | gpt-5-5 | OpenAI | 1154 | elo |
| MiniMax M3 | #11 | minimax-m3 | MiniMax | 1110 | elo |
| Gemini 3.6 Flash | #12 | gemini-3-6-flash | 964 | elo | |
| DeepSeek V4 Pro | #13 | deepseek-v4-pro | DeepSeek | 932 | elo |
| Qwen3.7-Max | #14 | qwen-3-7-max | Alibaba Cloud | 912 | elo |
| MiMo-V2.5-Pro | #15 | mimo-v2-5-pro | Xiaomi | 878 | elo |
| Nemotron 3 Ultra | #16 | nemotron-3-ultra | NVIDIA | 873 | elo |
| Muse Spark 1.1 | #17 | muse-spark-1-1 | Meta | 868 | elo |
| Inkling | #18 | inkling | Thinking Machines Lab | 839 | elo |
| DeepSeek V4 Flash | #19 | deepseek-v4-flash | DeepSeek | 833 | elo |
| Gemini 3.5 Flash-Lite | #20 | gemini-3-5-flash-lite | 636 | elo | |
| Mistral Medium 3.5 128B | #21 | mistral-medium-3-5-128b | Mistral AI | 516 | elo |
One best compatible score per canonical product · higher is better
| Rank | Model | Weights | Evidence | Score |
|---|---|---|---|---|
| 01 | Claude Opus 5Anthropic | Closed weights | Source carrier | 1720 elo |
| 02 | Grok 4.6xAI | Closed weights | Public reference | 1577 elo |
| 03 | Claude Fable 5Anthropic | Closed weights | Source carrier | 1574 elo |
| 04 | Kimi K3Moonshot AI | Open weights | Source carrier | 1543 elo |
| 05 | GPT-5.6 SolOpenAI | Closed weights | Source carrier | 1505 elo |
| 06 | Claude Sonnet 5Anthropic | Closed weights | Source carrier | 1388 elo |
| 07 | Claude Opus 4.8Anthropic | Closed weights | Source carrier | 1347 elo |
| 08 | Grok 4.5xAI | Closed weights | Source carrier | 1323 elo |
| 09 | GLM-5.2Z.AI | Open weights | Source carrier | 1260 elo |
| 10 | GPT-5.5OpenAI | Closed weights | Source carrier | 1154 elo |
Each distinct published measurement is retained. Same-snapshot canonical and configuration projections appear once.
| Published model / configuration | Score | Evidence & protocol | Source & dates |
|---|---|---|---|
Grok 4.6 HighGrok 4.6Exact identitygrok-4-6-high Canonical product: grok-4-6 | 1577 elo | Public referenceprovider-reportedVersion & system2026 xAI Grok 4.6 official release comparison table | Grok 4.6Observed Checked |
Fable 5 MaxClaude Fable 5Exact identityclaude-fable-5-max Canonical product: claude-fable-5 | 1574 elo | Public referenceprovider-reportedVersion & system2026 xAI Grok 4.6 official release comparison table | Grok 4.6Observed Checked |
GPT-5.6 Sol MaxGPT-5.6 SolExact identitygpt-5-6-sol-max Canonical product: gpt-5-6-sol | 1502 elo | Public referenceprovider-reportedVersion & system2026 xAI Grok 4.6 official release comparison table | Grok 4.6Observed Checked |
Grok 4.5 HighGrok 4.5Exact identitygrok-4-5-aa-2-high Canonical product: grok-4-5 | 1313 elo | Public referenceprovider-reportedVersion & system2026 xAI Grok 4.6 official release comparison table | Grok 4.6Observed Checked |
Exact BenchLM registry variant Claude Opus 5; bulk export does not retain a complete upstream harness configuration.Claude Opus 5Exact identitySource label without a registered configuration ID Canonical product: claude-opus-5 | 1720 elo | Source carriersource-checkedVersion & system2026 Source-native system | BenchLM public datasets — 2026-08-01Observed Checked |
Exact BenchLM registry variant Claude Fable 5; bulk export does not retain a complete upstream harness configuration.Claude Fable 5Exact identitySource label without a registered configuration ID Canonical product: claude-fable-5 | 1574 elo | Source carriersource-checkedVersion & system2026 Source-native system | BenchLM public datasets — 2026-08-01Observed Checked |
Exact BenchLM registry variant Kimi K3; bulk export does not retain a complete upstream harness configuration.Kimi K3Exact identitySource label without a registered configuration ID Canonical product: kimi-k3 | 1540 elo | Source carriersource-checkedVersion & system2026 Source-native system | BenchLM public datasets — 2026-08-01Observed Checked |
Exact BenchLM registry variant GPT-5.6 Sol; bulk export does not retain a complete upstream harness configuration.GPT-5.6 SolExact identitySource label without a registered configuration ID Canonical product: gpt-5-6-sol | 1503 elo | Source carriersource-checkedVersion & system2026 Source-native system | BenchLM public datasets — 2026-08-01Observed Checked |
Exact BenchLM registry variant Claude Sonnet 5; bulk export does not retain a complete upstream harness configuration.Claude Sonnet 5Exact identitySource label without a registered configuration ID Canonical product: claude-sonnet-5 | 1386 elo | Source carriersource-checkedVersion & system2026 Source-native system | BenchLM public datasets — 2026-08-01Observed Checked |
Exact BenchLM registry variant Claude Opus 4.8; bulk export does not retain a complete upstream harness configuration.Claude Opus 4.8Exact identitySource label without a registered configuration ID Canonical product: claude-opus-4-8 | 1346 elo | Source carriersource-checkedVersion & system2026 Source-native system | BenchLM public datasets — 2026-08-01Observed Checked |
From result to context
An independently evaluated professional-work benchmark reported as Elo.
The summary shows one best compatible source result per canonical product. Versions, effort settings and execution systems remain attached to the underlying records.
Scores from different versions or harnesses may not be interchangeable. The published source rows preserve those distinctions and their original units. A source result is not automatically an input to a current index.
This catalogue entry preserves available source evidence. Current indices admit only their specifically reviewed tracks and configurations.
Contamination risk: Unknown. Lifecycle: Active.