A task with its own rules.
Artificial Analysis agentic evaluation of OpenAI GDPval real-world economic work tasks across occupations, scored with pairwise Elo then normalized.
- Organisation
- Artificial Analysis / OpenAI
- Version
- v2
Agents / Benchmark profile
Artificial Analysis agentic evaluation of OpenAI GDPval real-world economic work tasks across occupations, scored with pairwise Elo then normalized.
Observed results
20 ranked models · higher is better · labels show rank and score
| Model | Rank | Model ID | Provider | Score | Unit |
|---|---|---|---|---|---|
| Claude Opus 5 | #1 | claude-opus-5 | Anthropic | 1862 | elo |
| Claude Fable 5 | #2 | claude-fable-5 | Anthropic | 1748 | elo |
| GPT-5.6 Sol | #3 | gpt-5-6-sol | OpenAI | 1736 | elo |
| Kimi K3 | #4 | kimi-k3 | Moonshot AI | 1687 | elo |
| Claude Sonnet 5 | #5 | claude-sonnet-5 | Anthropic | 1607 | elo |
| Claude Opus 4.8 | #6 | claude-opus-4-8 | Anthropic | 1594 | elo |
| GPT-5.6 Luna | #7 | gpt-5-6-luna | OpenAI | 1584 | elo |
| GPT-5.6 Terra | #8 | gpt-5-6-terra | OpenAI | 1583 | elo |
| Grok 4.5 | #9 | grok-4-5 | xAI | 1535 | elo |
| GLM-5.2 | #10 | glm-5-2 | Z.AI | 1514 | elo |
| Claude Opus 4.7 | #11 | claude-opus-4-7 | Anthropic | 1495 | elo |
| GPT-5.5 | #12 | gpt-5-5 | OpenAI | 1491 | elo |
| Gemini 3.6 Flash | #13 | gemini-3-6-flash | 1423 | elo | |
| GPT-5.4 | #14 | gpt-5-4 | OpenAI | 1395 | elo |
| MiniMax M3 | #15 | minimax-m3 | MiniMax | 1395 | elo |
| Muse Spark 1.1 | #16 | muse-spark-1-1 | Meta | 1375 | elo |
| Gemini 3.5 Flash | #17 | gemini-3-5-flash | 1349 | elo | |
| DeepSeek V4 Pro | #18 | deepseek-v4-pro | DeepSeek | 1307 | elo |
| Qwen3.7-Max | #19 | qwen-3-7-max | Alibaba Cloud | 1273 | elo |
| MiMo-V2.5-Pro | #20 | mimo-v2-5-pro | Xiaomi | 1265 | elo |
| GLM-5.1 | #21 | glm-5-1 | Z.AI | 1257 | elo |
| Inkling | #22 | inkling | Thinking Machines Lab | 1239 | elo |
| Hy3 | #23 | hy3 | Tencent | 1215 | elo |
| Hy3 Preview | #24 | hy3-preview | Tencent | 1215 | elo |
| DeepSeek V4 Flash | #25 | deepseek-v4-flash | DeepSeek | 1189 | elo |
| Kimi K2.6 | #26 | kimi-k2-6 | Moonshot AI | 1189 | elo |
| Kimi K2.7 Code | #27 | kimi-k2-7-code | Moonshot AI | 1187 | elo |
| GPT-5.4 mini | #28 | gpt-5-4-mini | OpenAI | 1171 | elo |
| GLM-4.7 | #29 | glm-4-7 | Z.AI | 1166 | elo |
| Nemotron 3 Ultra | #30 | nemotron-3-ultra | NVIDIA | 1164 | elo |
| MiniMax M2.7 | #31 | minimax-m2-7 | MiniMax | 1159 | elo |
| Muse Spark | #32 | muse-spark | Meta | 1144 | elo |
| Gemini 3.5 Flash-Lite | #33 | gemini-3-5-flash-lite | 1140 | elo | |
| Qwen3.6 27B | #34 | qwen3-6-27b | Alibaba Cloud | 1140 | elo |
| Qwen3.6 Plus | #35 | qwen3-6-plus | Alibaba Cloud | 1139 | elo |
| GPT-5.4 nano | #36 | gpt-5-4-nano | OpenAI | 1101 | elo |
| Grok 4.3 | #37 | grok-4-3 | xAI | 1085 | elo |
| GPT-5 | #38 | gpt-5 | OpenAI | 1079 | elo |
| Qwen3.6-35B-A3B | #39 | qwen3-6-35b-a3b | Alibaba Cloud | 1052 | elo |
| Step 3.7 Flash | #40 | step-3-7-flash | StepFun | 1017 | elo |
| Kimi K2.5 | #41 | kimi-k2-5 | Moonshot AI | 1009 | elo |
| GPT-5.1 | #42 | gpt-5-1 | OpenAI | 988 | elo |
| Qwen3.5-122B-A10B | #43 | qwen3-5-122b-a10b | Alibaba Cloud | 982 | elo |
| Qwen3.5 397B A17B | #44 | qwen3-5-397b | Alibaba Cloud | 962 | elo |
| Muse Glimmer 30B | #45 | muse-glimmer-30b | Meta | 953 | Elo |
| Qwen3.7-Plus | #46 | qwen-3-7-plus | Alibaba Cloud | 943 | elo |
| Mistral Medium 3.5 128B | #47 | mistral-medium-3-5-128b | Mistral AI | 933 | elo |
| Gemma 4 31B | #48 | gemma-4-31b | 811 | elo | |
| GPT-OSS 120B | #49 | gpt-oss-120b | OpenAI | 802 | elo |
| Gemma 4 26B A4B | #50 | gemma-4-26b-a4b | 770 | elo | |
| Command A+ | #51 | command-a-plus | Cohere | 718 | elo |
| Gemini 2.5 Pro | #52 | gemini-2-5-pro | 672 | elo | |
| Gemma 4 12B Unified | #53 | gemma-4-12b | 651 | elo | |
| Gemini 3.1 Flash-Lite | #54 | gemini-3-1-flash-lite | 649 | elo | |
| Mistral Large 3 | #55 | mistral-large-3 | Mistral AI | 640 | elo |
| K-Exaone | #56 | k-exaone | LG AI Research | 598 | elo |
| Mistral Small 4 | #57 | mistral-small-4 | Mistral AI | 592 | elo |
| GPT-OSS 20B | #58 | gpt-oss-20b | OpenAI | 567 | elo |
| Trinity-Large-Preview | #59 | trinity-large-preview | Arcee AI | 564 | elo |
| Trinity-Large-Thinking | #60 | trinity-large-thinking | Arcee AI | 564 | elo |
| Ling 2.6 Flash | #61 | ling-2-6-flash | InclusionAI | 550 | elo |
| GPT-4.1 mini | #62 | gpt-4-1-mini | OpenAI | 508 | elo |
| Nemotron 3 Nano 30B | #63 | nemotron-3-nano-30b | NVIDIA | 492 | elo |
| Nemotron 3 Nano Omni 30B A3B | #64 | nemotron-3-nano-omni-30b-a3b | NVIDIA | 467 | elo |
| GPT-4o mini | #65 | gpt-4o-mini | OpenAI | 241 | elo |
| DeepSeek V3 | #66 | deepseek-v3 | DeepSeek | 231 | elo |
| Gemma 4 E4B | #67 | gemma-4-e4b | 231 | elo | |
| Llama 4 Scout | #68 | llama-4-scout | Meta | 111 | elo |
| Gemma 4 E2B | #69 | gemma-4-e2b | 88 | elo | |
| GLM-5.3-Flash | #70 | glm-5-3-flash | Z.AI | 63.1915 | percent |
| GLM-5.3 | #71 | glm-5-3 | Z.AI | 63.1485 | percent |
| GPT-4.1 nano | #72 | gpt-4-1-nano | OpenAI | 63 | elo |
| Qwen3.8-Flash-Next | #73 | qwen-3-8-flash-next | Alibaba Cloud | 62.139 | percent |
| Grok 4.6 | #74 | grok-4-6 | xAI | 61.444500000000005 | percent |
| DeepSeek V4 Flash Vision Exp | #75 | deepseek-v4-flash-vision-exp | DeepSeek | 58.1405 | percent |
| Muse Spark 1.2 | #76 | muse-spark-1-2 | Meta | 56.55 | percent |
| Claude Opus 4 | #77 | claude-opus-4 | Anthropic | 56.5145 | percent |
| DeepSeek V4 Pro 0813 | #78 | deepseek-v4-pro-0813 | DeepSeek | 53.886 | percent |
| Gemini 3.7 Flash | #79 | gemini-3-7-flash | 49.5595 | percent | |
| Claude Sonnet 4.6 | #80 | claude-sonnet-4-6 | Anthropic | 43.858 | percent |
| Claude Sonnet 3.7 | #81 | claude-sonnet-3-7 | Anthropic | 35.871 | percent |
| MiMo-V2.5 | #82 | mimo-v2-5 | Xiaomi | 32.2505 | percent |
| Claude Sonnet 4.5 | #83 | claude-sonnet-4-5 | Anthropic | 27.623 | percent |
| LongCat-2.0 | #84 | longcat-2-0 | Meituan | 26.6095 | percent |
| Qwen3.5 122B | #85 | qwen3-5-122b | Alibaba Cloud | 23.901 | percent |
| Gemini 3.1 Pro Preview | #86 | gemini-3-1-pro-preview | 23.1155 | percent | |
| GPT-5 mini | #87 | gpt-5-mini | OpenAI | 21.8 | percent |
| GLM-4.6 | #88 | glm-4-6 | Z.AI | 21.6785 | percent |
| Mistral Medium 3.5 | #89 | mistral-medium-3-5 | Mistral AI | 21.4475 | percent |
| Claude Haiku 4.5 | #90 | claude-haiku-4-5 | Anthropic | 20.3305 | percent |
| DeepSeek V3.1 Terminus | #91 | deepseek-v3-1-terminus | DeepSeek | 19.464 | percent |
| DeepSeek V3.2 | #92 | deepseek-v3-2 | DeepSeek | 18.274 | percent |
| Claude Sonnet 4 | #93 | claude-sonnet-4 | Anthropic | 18.0275 | percent |
| Claude Opus 4.1 | #94 | claude-opus-4-1 | Anthropic | 15.2015 | percent |
| Gemma 4 26B | #95 | gemma-4-26b | 13.0665 | percent | |
| Nemotron 3 Super | #96 | nemotron-3-super | NVIDIA | 9.6625 | percent |
| Nova 2 Pro | #97 | nova-2-pro | Amazon | 8.811 | percent |
| Llama 4 Maverick | #98 | llama-4-maverick | Meta | 7 | elo |
| GLM-5V-Turbo | #99 | glm-5v-turbo | Z.AI | 4.5075 | percent |
| Grok Code Fast 1 | #100 | grok-code-fast-1 | xAI | 2.7365 | percent |
| Gemma 3 27B | #101 | gemma-3-27b | 0 | percent | |
| Ling 2.6 1T | #102 | ling-2-6-1t | InclusionAI | 0 | percent |
| MiMo-V2-Omni | #103 | mimo-v2-omni | Xiaomi | 0 | percent |
One best compatible score per canonical product · higher is better
| Rank | Model | Weights | Evidence | Score |
|---|---|---|---|---|
| 01 | Claude Opus 5Anthropic | Closed weights | Source carrier | 1862 elo |
| 02 | Claude Fable 5Anthropic | Closed weights | Source carrier | 1748 elo |
| 03 | GPT-5.6 SolOpenAI | Closed weights | Source carrier | 1736 elo |
| 04 | Kimi K3Moonshot AI | Open weights | Source carrier | 1687 elo |
| 05 | Claude Sonnet 5Anthropic | Closed weights | Source carrier | 1607 elo |
| 06 | Claude Opus 4.8Anthropic | Closed weights | Source carrier | 1594 elo |
| 07 | GPT-5.6 LunaOpenAI | Closed weights | Source carrier | 1584 elo |
| 08 | GPT-5.6 TerraOpenAI | Closed weights | Source carrier | 1583 elo |
| 09 | Grok 4.5xAI | Closed weights | Source carrier | 1535 elo |
| 10 | GLM-5.2Z.AI | Open weights | Source carrier | 1514 elo |
Each distinct published measurement is retained. Same-snapshot canonical and configuration projections appear once.
| Published model / configuration | Score | Evidence & protocol | Source & dates |
|---|---|---|---|
Claude Opus 5 (Adaptive Reasoning, Max Effort) (Artificial Analysis independent run)Claude Opus 5Exact identityclaude-opus-5-max Canonical product: claude-opus-5 | 66.2% | Direct source resultindependently-verifiedVersion & systemv2 Artificial Analysis GDPval-AA v2 | Claude Opus 5 (Adaptive Reasoning, Max Effort) individual evaluationsObserved Checked |
Qwen3.8-Flash-Next (Artificial Analysis independent run)Qwen3.8-Flash-NextExact identityqwen-3-8-flash-next-aa-unspecified Canonical product: qwen-3-8-flash-next | 62.1% | Public referenceindependently-verifiedVersion & systemv2 Artificial Analysis GDPval-AA v2 | Qwen3.8-Flash-Next individual evaluationsObserved Checked |
GLM-5.2 (max) (Artificial Analysis independent run)GLM-5.2Exact identityglm-5-2-max Canonical product: glm-5-2 | 49.9% | Direct source resultindependently-verifiedVersion & systemv2 Artificial Analysis GDPval-AA v2 | GLM-5.2 (max) individual evaluationsObserved Checked |
Claude Opus 4.7 (Adaptive Reasoning, Max Effort) (Artificial Analysis independent run)Claude Opus 4.7Exact identityclaude-opus-4-7-max Canonical product: claude-opus-4-7 | 49.1% | Direct source resultindependently-verifiedVersion & systemv2 Artificial Analysis GDPval-AA v2 | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) individual evaluationsObserved Checked |
Qwen3.6 35B A3B (Reasoning) (Artificial Analysis completed independent run)Qwen3.6-35B-A3BExact identityqwen3-6-35b-a3b-aa-reasoning-default Canonical product: qwen3-6-35b-a3b | 27.8% | Direct source resultindependently-verifiedVersion & systemv2 Artificial Analysis GDPval-AA v2 | Qwen3.6 35B A3B (Reasoning) current model and individual-evaluation pageObserved Checked |
LongCat 2.0 (Artificial Analysis independent run)LongCat-2.0Exact identitylongcat-2-0-default Canonical product: longcat-2-0 | 26.6% | Direct source resultindependently-verifiedVersion & systemv2 Artificial Analysis GDPval-AA v2 | LongCat 2.0 individual evaluationsObserved Checked |
Kimi K2.5 (Reasoning) (Artificial Analysis completed independent run)Kimi K2.5Exact identitykimi-k2-5-thinking Canonical product: kimi-k2-5 | 25.3% | Direct source resultindependently-verifiedVersion & systemv2 Artificial Analysis GDPval-AA v2 | Kimi K2.5 (Reasoning) current model and individual-evaluation pageObserved Checked |
Qwen3.5 122B A10B (Reasoning) (Artificial Analysis completed independent run)Qwen3.5-122B-A10BExact identityqwen3-5-122b-a10b-aa-reasoning-default Canonical product: qwen3-5-122b-a10b | 24.4% | Direct source resultindependently-verifiedVersion & systemv2 Artificial Analysis GDPval-AA v2 | Qwen3.5 122B A10B (Reasoning) current model and individual-evaluation pageObserved Checked |
Qwen3.5 397B A17B (Reasoning) (Artificial Analysis completed independent run)Qwen3.5 397B A17BExact identityqwen3-5-397b-thinking Canonical product: qwen3-5-397b | 23.3% | Direct source resultindependently-verifiedVersion & systemv2 Artificial Analysis GDPval-AA v2 | Qwen3.5 397B A17B (Reasoning) current model and individual-evaluation pageObserved Checked |
Mistral Medium 3.5 (Artificial Analysis completed independent run)Mistral Medium 3.5 128BExact identitymistral-medium-3-5-128b-aa-reasoning-default Canonical product: mistral-medium-3-5-128b | 21.8% | Direct source resultindependently-verifiedVersion & systemv2 Artificial Analysis GDPval-AA v2 | Mistral Medium 3.5 current model and individual-evaluation pageObserved Checked |
From result to context
Artificial Analysis agentic evaluation of OpenAI GDPval real-world economic work tasks across occupations, scored with pairwise Elo then normalized.
The summary shows one best compatible source result per canonical product. Versions, effort settings and execution systems remain attached to the underlying records.
Scores from different versions or harnesses may not be interchangeable. The published source rows preserve those distinctions and their original units. A source result is not automatically an input to a current index.
This catalogue entry preserves available source evidence. Current indices admit only their specifically reviewed tracks and configurations.
Contamination risk: Low. Lifecycle: Active.