| AA Long Context Reasoningstandard | 75.333% | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) (Artificial Analysis independent run)Artificial Analysis AA-LCR evaluation | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) individual evaluations ↗Observed 2026-08-29 · checked 2026-08-29independently-verified · ranking-eligible |
|---|
| CritPtstandard | 12% | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) (Artificial Analysis independent run)Artificial Analysis CritPt evaluation | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) individual evaluations ↗Observed 2026-08-29 · checked 2026-08-29independently-verified · ranking-eligible |
|---|
| GDPval-AA v2v2 | 49.142% | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) (Artificial Analysis independent run)Artificial Analysis GDPval-AA v2 | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) individual evaluations ↗Observed 2026-08-29 · checked 2026-08-29independently-verified · ranking-eligible |
|---|
| GPQA Diamonddiamond | 91.414% | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) (Artificial Analysis independent run)Artificial Analysis GPQA Diamond evaluation | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) individual evaluations ↗Observed 2026-08-29 · checked 2026-08-29independently-verified · ranking-eligible |
|---|
| Humanity's Last Examtext-only current | 42.308% | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) (Artificial Analysis independent run)Artificial Analysis text-only HLE evaluation | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) individual evaluations ↗Observed 2026-08-29 · checked 2026-08-29independently-verified · ranking-eligible |
|---|
| SciCode2024 | 54.514% | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) (Artificial Analysis independent run)Artificial Analysis SciCode evaluation | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) individual evaluations ↗Observed 2026-08-29 · checked 2026-08-29independently-verified · reference-only |
|---|
| τ³-Banking3 | 34.639% | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) (Artificial Analysis independent run)Artificial Analysis tau3-Banking evaluation | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) individual evaluations ↗Observed 2026-08-29 · checked 2026-08-29independently-verified · ranking-eligible |
|---|
| Terminal-Bench2.1 | 83.146% | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) (Artificial Analysis independent run)Artificial Analysis Terminal-Bench v2.1 in e2b | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) individual evaluations ↗Observed 2026-08-29 · checked 2026-08-29independently-verified · ranking-eligible |
|---|
| GPQA Diamond2026 | 88.5% | Exact BenchLM registry variant Claude Opus 4.7; bulk export does not retain a complete upstream harness configuration.Source-native system | BenchLM public datasets — 21 July 2026 ↗Observed 2026-07-21 · checked 2026-07-21source-checked · reference-only |
|---|
| GPQA Diamond2026 | 88.5% | Exact BenchLM registry variant Claude Opus 4.7; bulk export does not retain a complete upstream harness configuration.Source-native system | BenchLM public datasets — 2026-07-27 ↗Observed 2026-07-27 · checked 2026-07-27source-checked · reference-only |
|---|