| AA Long Context Reasoningstandard | 72.667% | Qwen3.5 397B A17B (Reasoning) (Artificial Analysis completed independent run)Artificial Analysis AA-LCR evaluation | Qwen3.5 397B A17B (Reasoning) current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29independently-verified · ranking-eligible |
|---|
| CritPtstandard | 1.706% | Qwen3.5 397B A17B (Reasoning) (Artificial Analysis completed independent run)Artificial Analysis CritPt evaluation | Qwen3.5 397B A17B (Reasoning) current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29independently-verified · ranking-eligible |
|---|
| GDPval-AA v2v2 | 23.318% | Qwen3.5 397B A17B (Reasoning) (Artificial Analysis completed independent run)Artificial Analysis GDPval-AA v2 | Qwen3.5 397B A17B (Reasoning) current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29independently-verified · ranking-eligible |
|---|
| GPQA Diamonddiamond | 89.293% | Qwen3.5 397B A17B (Reasoning) (Artificial Analysis completed independent run)Artificial Analysis GPQA Diamond evaluation | Qwen3.5 397B A17B (Reasoning) current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29independently-verified · ranking-eligible |
|---|
| Humanity's Last Examtext-only current | 28.962% | Qwen3.5 397B A17B (Reasoning) (Artificial Analysis completed independent run)Artificial Analysis text-only HLE evaluation | Qwen3.5 397B A17B (Reasoning) current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29independently-verified · ranking-eligible |
|---|
| SciCode2024 | 42.014% | Qwen3.5 397B A17B (Reasoning) (Artificial Analysis completed independent run)Artificial Analysis SciCode evaluation | Qwen3.5 397B A17B (Reasoning) current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29independently-verified · reference-only |
|---|
| τ³-Banking3 | 13.402% | Qwen3.5 397B A17B (Reasoning) (Artificial Analysis completed independent run)Artificial Analysis tau3-Banking evaluation | Qwen3.5 397B A17B (Reasoning) current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29independently-verified · ranking-eligible |
|---|
| Terminal-Bench2.1 | 51.311% | Qwen3.5 397B A17B (Reasoning) (Artificial Analysis completed independent run)Artificial Analysis Terminal-Bench v2.1 in e2b | Qwen3.5 397B A17B (Reasoning) current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29independently-verified · ranking-eligible |
|---|
| Artificial Analysis Agentic Index2026 | 19.85 index | Exact BenchLM registry variant Qwen3.5 397B; bulk export does not retain a complete upstream harness configuration.Source-native system | BenchLM public datasets — 21 July 2026 ↗Observed 2026-07-21 · checked 2026-07-21source-checked · reference-only |
|---|
| Artificial Analysis Agentic Index2026 | 19.85 index | Exact BenchLM registry variant Qwen3.5 397B; bulk export does not retain a complete upstream harness configuration.Source-native system | BenchLM public datasets — 2026-07-27 ↗Observed 2026-07-27 · checked 2026-07-27source-checked · reference-only |
|---|