| CritPtstandard | 30% | GPT-5.4 Pro (xhigh) (Artificial Analysis completed independent run)Artificial Analysis CritPt evaluation | GPT-5.4 Pro (xhigh) current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29independently-verified · reference-only |
|---|
| AA Long Context Reasoningstandard | 77.667% | GPT-5.4 (xhigh; Artificial Analysis independent run)Artificial Analysis AA-LCR evaluation | GPT-5.4 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27independently-verified · ranking-eligible |
|---|
| CritPtstandard | 23.429% | GPT-5.4 (xhigh; Artificial Analysis independent run)Artificial Analysis CritPt evaluation | GPT-5.4 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27independently-verified · ranking-eligible |
|---|
| GDPval-AA v2v2 | 44.405% | GPT-5.4 (xhigh; Artificial Analysis independent run)Artificial Analysis GDPval-AA v2 using Stirrup | GPT-5.4 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27independently-verified · ranking-eligible |
|---|
| GPQA Diamonddiamond | 92.02% | GPT-5.4 (xhigh; Artificial Analysis independent run)Artificial Analysis GPQA Diamond evaluation | GPT-5.4 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27independently-verified · ranking-eligible |
|---|
| Humanity's Last Examtext-only current | 43.744% | GPT-5.4 (xhigh; Artificial Analysis independent run)Artificial Analysis text-only Humanity's Last Exam evaluation | GPT-5.4 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27independently-verified · ranking-eligible |
|---|
| SciCoderolling | 56.597% | GPT-5.4 (xhigh; Artificial Analysis independent run)Artificial Analysis SciCode evaluation | GPT-5.4 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27independently-verified · reference-only |
|---|
| τ³-Banking3 | 39.588% | GPT-5.4 (xhigh; Artificial Analysis independent run)Artificial Analysis tau3-Banking evaluation | GPT-5.4 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27independently-verified · ranking-eligible |
|---|
| Terminal-Bench2.1 | 78.277% | GPT-5.4 (xhigh; Artificial Analysis independent run)Artificial Analysis Terminal-Bench v2.1 in e2b | GPT-5.4 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27independently-verified · ranking-eligible |
|---|
| Artificial Analysis Agentic Index2026 | 41.08 index | Exact BenchLM registry variant GPT-5.4; bulk export does not retain a complete upstream harness configuration.Source-native system | BenchLM public datasets — 21 July 2026 ↗Observed 2026-07-21 · checked 2026-07-21source-checked · reference-only |
|---|