| AA Long Context Reasoningstandard | 79% | GPT-5.5 (xhigh; Artificial Analysis independent run)Artificial Analysis AA-LCR evaluation | GPT-5.5 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27independently-verified · ranking-eligible |
|---|
| CritPtstandard | 27.143% | GPT-5.5 (xhigh; Artificial Analysis independent run)Artificial Analysis CritPt evaluation | GPT-5.5 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27independently-verified · ranking-eligible |
|---|
| GDPval-AA v2v2 | 49.243% | GPT-5.5 (xhigh; Artificial Analysis independent run)Artificial Analysis GDPval-AA v2 using Stirrup | GPT-5.5 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27independently-verified · ranking-eligible |
|---|
| GPQA Diamonddiamond | 93.535% | GPT-5.5 (xhigh; Artificial Analysis independent run)Artificial Analysis GPQA Diamond evaluation | GPT-5.5 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27independently-verified · ranking-eligible |
|---|
| Humanity's Last Examtext-only current | 45.783% | GPT-5.5 (xhigh; Artificial Analysis independent run)Artificial Analysis text-only Humanity's Last Exam evaluation | GPT-5.5 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27independently-verified · ranking-eligible |
|---|
| SciCoderolling | 56.134% | GPT-5.5 (xhigh; Artificial Analysis independent run)Artificial Analysis SciCode evaluation | GPT-5.5 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27independently-verified · reference-only |
|---|
| τ³-Banking3 | 38.969% | GPT-5.5 (xhigh; Artificial Analysis independent run)Artificial Analysis tau3-Banking evaluation | GPT-5.5 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27independently-verified · ranking-eligible |
|---|
| Terminal-Bench2.1 | 84.27% | GPT-5.5 (xhigh; Artificial Analysis independent run)Artificial Analysis Terminal-Bench v2.1 in e2b | GPT-5.5 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27independently-verified · ranking-eligible |
|---|
| Artificial Analysis Agentic Index2026 | 44.87 index | Exact BenchLM registry variant GPT-5.5; bulk export does not retain a complete upstream harness configuration.Source-native system | BenchLM public datasets — 21 July 2026 ↗Observed 2026-07-21 · checked 2026-07-21source-checked · reference-only |
|---|
| Artificial Analysis Agentic Index2026 | 44.87 index | Exact BenchLM registry variant GPT-5.5; bulk export does not retain a complete upstream harness configuration.Source-native system | BenchLM public datasets — 2026-07-27 ↗Observed 2026-07-27 · checked 2026-07-27source-checked · reference-only |
|---|