| AA Long Context Reasoningstandard | 73% | Claude Opus 4.8 (max; Artificial Analysis independent run)Artificial Analysis AA-LCR evaluation | Claude Opus 4.8 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27independently-verified · ranking-eligible |
|---|
| CritPtstandard | 20.857% | Claude Opus 4.8 (max; Artificial Analysis independent run)Artificial Analysis CritPt evaluation | Claude Opus 4.8 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27independently-verified · ranking-eligible |
|---|
| GDPval-AA v2v2 | 53.894% | Claude Opus 4.8 (max; Artificial Analysis independent run)Artificial Analysis GDPval-AA v2 using Stirrup | Claude Opus 4.8 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27independently-verified · ranking-eligible |
|---|
| GPQA Diamonddiamond | 92.02% | Claude Opus 4.8 (max; Artificial Analysis independent run)Artificial Analysis GPQA Diamond evaluation | Claude Opus 4.8 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27independently-verified · ranking-eligible |
|---|
| Humanity's Last Examtext-only current | 48.656% | Claude Opus 4.8 (max; Artificial Analysis independent run)Artificial Analysis text-only Humanity's Last Exam evaluation | Claude Opus 4.8 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27independently-verified · ranking-eligible |
|---|
| SciCoderolling | 53.472% | Claude Opus 4.8 (max; Artificial Analysis independent run)Artificial Analysis SciCode evaluation | Claude Opus 4.8 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27independently-verified · reference-only |
|---|
| τ³-Banking3 | 34.227% | Claude Opus 4.8 (max; Artificial Analysis independent run)Artificial Analysis tau3-Banking evaluation | Claude Opus 4.8 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27independently-verified · ranking-eligible |
|---|
| Terminal-Bench2.1 | 84.644% | Claude Opus 4.8 (max; Artificial Analysis independent run)Artificial Analysis Terminal-Bench v2.1 in e2b | Claude Opus 4.8 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27independently-verified · ranking-eligible |
|---|
| Artificial Analysis Agentic Index2026 | 47.18 index | Exact BenchLM registry variant Claude Opus 4.8; bulk export does not retain a complete upstream harness configuration.Source-native system | BenchLM public datasets — 21 July 2026 ↗Observed 2026-07-21 · checked 2026-07-21source-checked · reference-only |
|---|
| Artificial Analysis Agentic Index2026 | 47.18 index | Exact BenchLM registry variant Claude Opus 4.8; bulk export does not retain a complete upstream harness configuration.Source-native system | BenchLM public datasets — 2026-07-27 ↗Observed 2026-07-27 · checked 2026-07-27source-checked · reference-only |
|---|