A task with its own rules.
The Diamond subset of a graduate-level, expert-written question-answering benchmark.
- Organisation
- GPQA authors
- Version
- Current / rolling
Reasoning / Benchmark profile
The Diamond subset of a graduate-level, expert-written question-answering benchmark.
Observed results
20 ranked models · higher is better · labels show rank and score
| Model | Rank | Model ID | Provider | Score | Unit |
|---|---|---|---|---|---|
| Sakana Fugu | #1 | sakana-fugu | Sakana AI | 95.5 | percent |
| Sakana Fugu-Ultra | #2 | sakana-fugu-ultra | Sakana AI | 95.5 | percent |
| Grok 4.6 | #3 | grok-4-6 | xAI | 94.949494949495 | percent |
| GPT-5.4 | #4 | gpt-5-4 | OpenAI | 94.6 | percent |
| GPT-5.6 Sol | #5 | gpt-5-6-sol | OpenAI | 94.6 | percent |
| Claude Opus 4.7 | #6 | claude-opus-4-7 | Anthropic | 94.2 | percent |
| Gemini 3.1 Pro Preview | #7 | gemini-3-1-pro-preview | 94.14 | percent | |
| Gemini 3.6 Flash | #8 | gemini-3-6-flash | 94.128788 | percent | |
| Claude Mythos 5 | #9 | claude-mythos-5 | Anthropic | 94.1 | percent |
| GPT-5.5 | #10 | gpt-5-5 | OpenAI | 94.002525 | percent |
| Claude Opus 5 | #11 | claude-opus-5 | Anthropic | 93.876263 | percent |
| Claude Opus 4.8 | #12 | claude-opus-4-8 | Anthropic | 93.6 | percent |
| Kimi K3 | #13 | kimi-k3 | Moonshot AI | 93.53535353535352 | percent |
| Grok 4.5 | #14 | grok-4-5 | xAI | 93.434343 | percent |
| GPT-5.6 Terra | #15 | gpt-5-6-terra | OpenAI | 93.308081 | percent |
| MiniMax M3 | #16 | minimax-m3 | MiniMax | 92.93 | percent |
| DeepSeek V4 Pro 0813 | #17 | deepseek-v4-pro-0813 | DeepSeek | 92.8282828282828 | percent |
| Gemini 3.5 Flash | #18 | gemini-3-5-flash | 92.80303 | percent | |
| Qwen3.8 Max | #19 | qwen-3-8-max | Alibaba Cloud | 92.676768 | percent |
| Claude Fable 5 | #20 | claude-fable-5 | Anthropic | 92.63 | percent |
| Qwen3.7-Max | #21 | qwen-3-7-max | Alibaba Cloud | 92.4 | percent |
| Qwen3.8-Flash-Next | #22 | qwen-3-8-flash-next | Alibaba Cloud | 92.323232323232 | percent |
| GPT-5.6 Luna | #23 | gpt-5-6-luna | OpenAI | 92.3 | percent |
| Gemini 3.7 Flash | #24 | gemini-3-7-flash | 92.12121212121212 | percent | |
| GLM-5.2 | #25 | glm-5-2 | Z.AI | 91.856061 | percent |
| GLM-5.3 | #26 | glm-5-3 | Z.AI | 91.7171717171717 | percent |
| GPT-5.3-Codex | #27 | gpt-5-3-codex | OpenAI | 91.52 | percent |
| GPT-5.2 | #28 | gpt-5-2 | OpenAI | 91.4 | percent |
| DeepSeek V4 Flash Vision Exp | #29 | deepseek-v4-flash-vision-exp | DeepSeek | 91.3131313131313 | percent |
| Claude Opus 4.6 | #30 | claude-opus-4-6 | Anthropic | 91.3 | percent |
| GLM-5.3-Flash | #31 | glm-5-3-flash | Z.AI | 91.2121212121212 | percent |
| Claude Sonnet 5 | #32 | claude-sonnet-5 | Anthropic | 91.1111111111111 | percent |
| Grok 4.20 | #33 | grok-4-20 | xAI | 91.1111 | percent |
| Kimi K2.6 | #34 | kimi-k2-6 | Moonshot AI | 91.1111 | percent |
| Muse Spark 1.2 | #35 | muse-spark-1-2 | Meta | 90.4040404040404 | percent |
| Hy3 | #36 | hy3 | Tencent | 90.4 | percent |
| Qwen3.6 Plus | #37 | qwen3-6-plus | Alibaba Cloud | 90.4 | percent |
| Qwen3.7-Plus | #38 | qwen-3-7-plus | Alibaba Cloud | 90.3 | percent |
| DeepSeek V4 Pro | #39 | deepseek-v4-pro | DeepSeek | 90.1 | percent |
| Grok 4.3 | #40 | grok-4-3 | xAI | 90.1 | percent |
| Claude Sonnet 4.6 | #41 | claude-sonnet-4-6 | Anthropic | 89.9 | percent |
| GPT-5.2 Codex | #42 | gpt-5-2-codex | OpenAI | 89.9 | percent |
| Interfaze Beta | #43 | interfaze-beta | Interfaze | 89.9 | percent |
| Muse Spark 1.1 | #44 | muse-spark-1-1 | Meta | 89.8 | percent |
| Kimi K2.7 Code | #45 | kimi-k2-7-code | Moonshot AI | 89.6 | percent |
| Inkling-Small | #46 | inkling-small | Thinking Machines Lab | 89.5 | percent |
| Muse Spark | #47 | muse-spark | Meta | 89.5 | percent |
| DeepSeek V4 Flash | #48 | deepseek-v4-flash | DeepSeek | 89.39 | percent |
| Qwen3.5 397B A17B | #49 | qwen3-5-397b | Alibaba Cloud | 89.3 | percent |
| Qwen3.8-27B | #50 | qwen-3-8-27b | Alibaba Cloud | 89.2 | percent |
| LongCat-2.0 | #51 | longcat-2-0 | Meituan | 88.9 | percent |
| Qwen 3.6 Max (preview) | #52 | qwen3-6-max-preview | Alibaba Cloud | 88.8 | percent |
| Qwen3.6 Max | #53 | qwen3-6-max | Alibaba Cloud | 88.7879 | percent |
| Inkling | #54 | inkling | Thinking Machines Lab | 88.257576 | percent |
| Kimi K2.5 | #55 | kimi-k2-5 | Moonshot AI | 87.9 | percent |
| Grok 4 | #56 | grok-4 | xAI | 87.7 | percent |
| GPT-5.1 | #57 | gpt-5-1 | OpenAI | 87.626263 | percent |
| GPT-5.4 mini | #58 | gpt-5-4-mini | OpenAI | 87.5 | percent |
| Hy3 Preview | #59 | hy3-preview | Tencent | 87.2 | percent |
| Claude Opus 4.5 | #60 | claude-opus-4-5 | Anthropic | 87 | percent |
| MiMo-V2-Pro | #61 | mimo-v2-pro | Xiaomi | 87 | percent |
| MiniMax M2.7 | #62 | minimax-m2-7 | MiniMax | 87 | percent |
| Nemotron 3 Ultra | #63 | nemotron-3-ultra | NVIDIA | 87 | percent |
| Claude Opus 4.5 Thinking | #64 | claude-opus-4-5-thinking | Anthropic | 86.6 | percent |
| MiMo-V2.5-Pro | #65 | mimo-v2-5-pro | Xiaomi | 86.6 | percent |
| Solar Open 2 250B | #66 | solar-open2-250b | Upstage | 86.3 | percent |
| GLM-5.1 | #67 | glm-5-1 | Z.AI | 86.2 | percent |
| Qwen3 Max | #68 | qwen3-max | Alibaba Cloud | 86.0606 | percent |
| GLM-5 | #69 | glm-5 | Z.AI | 86 | percent |
| GPT-5.1-Codex | #70 | gpt-5-1-codex | OpenAI | 86 | percent |
| GPT-5.1-Codex-Max | #71 | gpt-5-1-codex-max | OpenAI | 86 | percent |
| GLM-4.7 | #72 | glm-4-7 | Z.AI | 85.9 | percent |
| Qwen3.5 27B | #73 | qwen3-5-27b | Alibaba Cloud | 85.8 | percent |
| Gemma 4 31B | #74 | gemma-4-31b | 85.7 | percent | |
| Qwen3.5-122B-A10B | #75 | qwen3-5-122b-a10b | Alibaba Cloud | 85.7 | percent |
| Qwen3.5 122B | #76 | qwen3-5-122b | Alibaba Cloud | 85.6566 | percent |
| GPT-5 | #77 | gpt-5 | OpenAI | 85.4 | percent |
| Grok 4.1 Fast (Reasoning) | #78 | grok-4-1-fast-reasoning | xAI | 85.3 | percent |
| MiMo-V2.5 | #79 | mimo-v2-5 | Xiaomi | 84.9495 | percent |
| MiniMax M2.5 | #80 | minimax-m2-5 | MiniMax | 84.8485 | percent |
| Grok 4 Fast | #81 | grok-4-fast | xAI | 84.7475 | percent |
| GLM-5-Turbo | #82 | glm-5-turbo | Z.AI | 84.7 | percent |
| Grok 4 Fast (Reasoning) | #83 | grok-4-fast-reasoning | xAI | 84.7 | percent |
| o3-pro | #84 | o3-pro | OpenAI | 84.5455 | percent |
| Qwen3.5 35B | #85 | qwen3-5-35b | Alibaba Cloud | 84.5455 | percent |
| Qwen3.5-35B-A3B | #86 | qwen3-5-35b-a3b | Alibaba Cloud | 84.5 | percent |
| Gemini 2.5 Pro | #87 | gemini-2-5-pro | 84.4444 | percent | |
| Qwen3.6 27B | #88 | qwen3-6-27b | Alibaba Cloud | 84.2424 | percent |
| MAI-Thinking-1 | #89 | mai-thinking-1 | Microsoft | 84.2 | percent |
| Qwen3.6-35B-A3B | #90 | qwen3-6-35b-a3b | Alibaba Cloud | 84.141414141414 | percent |
| DeepSeek V3.2 | #91 | deepseek-v3-2 | DeepSeek | 84.0404 | percent |
| Kimi K2 Thinking | #92 | kimi-k2-thinking | Moonshot AI | 83.8384 | percent |
| Gemini 3.5 Flash-Lite | #93 | gemini-3-5-flash-lite | 83.8 | percent | |
| GPT-5 Codex | #94 | gpt-5-codex | OpenAI | 83.7374 | percent |
| Muse Glimmer 30B | #95 | muse-glimmer-30b | Meta | 83.5 | percent |
| Claude Sonnet 4.5 | #96 | claude-sonnet-4-5 | Anthropic | 83.4343 | percent |
| MiniMax M2.1 | #97 | minimax-m2-1 | MiniMax | 83.0303 | percent |
| GPT-5.4 nano | #98 | gpt-5-4-nano | OpenAI | 82.8 | percent |
| MiMo-V2-Omni | #99 | mimo-v2-omni | Xiaomi | 82.8 | percent |
| o3 | #100 | o3 | OpenAI | 82.7273 | percent |
| Qwen3.5 Omni Plus | #101 | qwen3-5-omni-plus | Alibaba Cloud | 82.6263 | percent |
| Gemini 3.1 Flash-Lite | #102 | gemini-3-1-flash-lite | 82.2 | percent | |
| DeepSeek-R1 | #103 | deepseek-r1 | DeepSeek | 81.3 | percent |
| Gemini 3 Flash | #104 | gemini-3-flash | 81.2 | percent | |
| Claude 4.1 Opus Thinking | #105 | claude-4-1-opus-thinking | Anthropic | 80.9 | percent |
| Claude Opus 4.1 | #106 | claude-opus-4-1 | Anthropic | 80.9 | percent |
| GLM-5V-Turbo | #107 | glm-5v-turbo | Z.AI | 80.9 | percent |
| Step 3.7 Flash | #108 | step-3-7-flash | StepFun | 80.9 | percent |
| GPT-5 mini | #109 | gpt-5-mini | OpenAI | 80.303 | percent |
| Nemotron 3 Super | #110 | nemotron-3-super | NVIDIA | 80 | percent |
| Claude Opus 4 | #111 | claude-opus-4 | Anthropic | 79.596 | percent |
| Gemini 2.5 Flash | #112 | gemini-2-5-flash | 79.2929 | percent | |
| Gemma 4 26B A4B | #113 | gemma-4-26b-a4b | 79.2 | percent | |
| DeepSeek V3.1 Terminus | #114 | deepseek-v3-1-terminus | DeepSeek | 79.1919 | percent |
| Gemma 4 26B | #115 | gemma-4-26b | 79.1919 | percent | |
| Grok 3 mini | #116 | grok-3-mini | xAI | 79.0909 | percent |
| Gemma 4 12B Unified | #117 | gemma-4-12b | 78.8 | percent | |
| Nova 2 Pro | #118 | nova-2-pro | Amazon | 78.4848 | percent |
| o4-mini | #119 | o4-mini | OpenAI | 78.3838 | percent |
| K-Exaone | #120 | k-exaone | LG AI Research | 78.3 | percent |
| GPT-OSS 120B | #121 | gpt-oss-120b | OpenAI | 78.2 | percent |
| GLM-4.6 | #122 | glm-4-6 | Z.AI | 77.9798 | percent |
| DeepSeek V3.1 | #123 | deepseek-v3-1 | DeepSeek | 77.9 | percent |
| Claude Sonnet 4 | #124 | claude-sonnet-4 | Anthropic | 77.6768 | percent |
| MiniMax M2 | #125 | minimax-m2 | MiniMax | 77.6768 | percent |
| Claude Sonnet 3.7 | #126 | claude-sonnet-3-7 | Anthropic | 77.1717 | percent |
| Mistral Small 4 | #127 | mistral-small-4 | Mistral AI | 76.9 | percent |
| Kimi K2 0905 | #128 | kimi-k2-0905 | Moonshot AI | 76.6667 | percent |
| Kimi K2 | #129 | kimi-k2 | Moonshot AI | 76.6 | percent |
| Trinity-Large-Thinking | #130 | trinity-large-thinking | Arcee AI | 76.3 | percent |
| Command A+ | #131 | command-a-plus | Cohere | 76.1 | percent |
| Nemotron 3 Nano 30B | #132 | nemotron-3-nano-30b | NVIDIA | 75.7 | percent |
| NVIDIA Nemotron 3.5 Lightning 30B-A3B | #133 | nemotron-3-5-lightning-30b-a3b | NVIDIA | 75.44 | percent |
| Ling 2.6 1T | #134 | ling-2-6-1t | InclusionAI | 75.1515 | percent |
| Mistral Medium 3.5 | #135 | mistral-medium-3-5 | Mistral AI | 74.85 | percent |
| Mistral Medium 3.5 128B | #136 | mistral-medium-3-5-128b | Mistral AI | 74.848484848485 | percent |
| o3-mini | #137 | o3-mini | OpenAI | 74.8 | percent |
| o1 | #138 | o1 | OpenAI | 74.7475 | percent |
| Sarvam 105B | #139 | sarvam-105b | Sarvam | 73.8 | percent |
| GLM-4.5-Air | #140 | glm-4-5-air | Z.AI | 73.3 | percent |
| Nemotron Ultra 253B | #141 | nemotron-ultra-253b | NVIDIA | 72.8 | percent |
| Grok Code Fast 1 | #142 | grok-code-fast-1 | xAI | 72.7273 | percent |
| Nemotron 3 Nano Omni 30B A3B | #143 | nemotron-3-nano-omni-30b-a3b | NVIDIA | 72.2 | percent |
| ZAYA1-8B | #144 | zaya1-8b | Zyphra | 71 | percent |
| GPT-5 nano | #145 | gpt-5-nano | OpenAI | 69.444444 | percent |
| GPT-OSS 20B | #146 | gpt-oss-20b | OpenAI | 68.8 | percent |
| Claude 4 Sonnet | #147 | claude-4-sonnet | Anthropic | 68.3 | percent |
| Mistral Large 3 | #148 | mistral-large-3 | Mistral AI | 68 | percent |
| Llama 4 Maverick | #149 | llama-4-maverick | Meta | 67.1 | percent |
| GPT-4.1 | #150 | gpt-4-1 | OpenAI | 66.6 | percent |
| GPT-4.1 mini | #151 | gpt-4-1-mini | OpenAI | 66.4 | percent |
| Claude Haiku 4.5 | #152 | claude-haiku-4-5 | Anthropic | 64.65 | percent |
| Grok 4.1 Fast | #153 | grok-4-1-fast | xAI | 63.7 | percent |
| Sarvam 30B | #154 | sarvam-30b | Sarvam | 63.3 | percent |
| Trinity-Large-Preview | #155 | trinity-large-preview | Arcee AI | 63.3 | percent |
| Exaone 4.0 32B | #156 | exaone-4-0-32b | LG AI Research | 62.8 | percent |
| DeepSeek R1 Distill Qwen 32B | #157 | deepseek-r1-distill-qwen-32b | DeepSeek | 61.5 | percent |
| Ling 2.6 Flash | #158 | ling-2-6-flash | InclusionAI | 59.3 | percent |
| Gemini 1.5 Pro | #159 | gemini-1-5-pro | 58.9 | percent | |
| Llama 4 Scout | #160 | llama-4-scout | Meta | 58.7 | percent |
| Mistral Medium 3 | #161 | mistral-medium-3 | Mistral AI | 57.8 | percent |
| Gemma 4 E4B | #162 | gemma-4-e4b | 57.6 | percent | |
| Mellum2-12B-A2.5B-Thinking | #163 | mellum2-12b-a2-5b-thinking | JetBrains | 57.6 | percent |
| Phi-4 | #164 | phi-4 | Microsoft | 57.5 | percent |
| ZAYA1-74B-Preview | #165 | zaya1-74b-preview | Zyphra | 57.3 | percent |
| Solar Pro 2 | #166 | solar-pro-2 | Upstage | 56.1 | percent |
| DeepSeek V3 | #167 | deepseek-v3 | DeepSeek | 55.7 | percent |
| GPT-4o | #168 | gpt-4o | OpenAI | 54.3 | percent |
| Llama 3.1 405B | #169 | llama-3-1-405b | Meta | 51.5 | percent |
| LFM2.5-8B-A1B | #170 | lfm2-5-8b-a1b | LiquidAI | 51.3 | percent |
| GPT-4.1 nano | #171 | gpt-4-1-nano | OpenAI | 51.212121212121 | percent |
| Nova Pro | #172 | nova-pro | Amazon | 49.9 | percent |
| Claude 3 Opus | #173 | claude-3-opus | Anthropic | 48.9 | percent |
| Mistral Large 2 | #174 | mistral-large-2 | Mistral AI | 48.6 | percent |
| Soofi S 30B-A3B | #175 | soofi-s-30b-a3b | Soofi Project | 43.4 | percent |
| Gemma 3 27B | #176 | gemma-3-27b | 42.828282828283 | percent | |
| GPT-4o mini | #177 | gpt-4o-mini | OpenAI | 42.6 | percent |
| Exaone 4.0 1.2B | #178 | exaone-4-0-1-2b | LG AI Research | 42.4 | percent |
| Qwen2.5 Coder 32B Instruct | #179 | qwen2-5-coder-32b-instruct | Alibaba Cloud | 41.7 | percent |
| Mellum2-12B-A2.5B-Instruct | #180 | mellum2-12b-a2-5b-instruct | JetBrains | 40.9 | percent |
| Gemma 4 E2B | #181 | gemma-4-e2b | 40.5 | percent | |
| Claude 3 Haiku | #182 | claude-3-haiku | Anthropic | 37.4 | percent |
| Granite-4.0-H-350M | #183 | granite-4-0-h-350m | IBM | 29 | percent |
| LFM2.5-VL-1.6B-Extract | #184 | lfm2-5-vl-1-6b-extract | LiquidAI | 28.9 | percent |
| Granite-4.0-1B | #185 | granite-4-0-1b | IBM | 28.1 | percent |
| Gemini 1.0 Pro | #186 | gemini-1-0-pro | 27.7 | percent | |
| Granite-4.0-H-1B | #187 | granite-4-0-h-1b | IBM | 26.3 | percent |
| MiniCPM5-1B | #188 | minicpm5-1b | OpenBMB | 26.26 | percent |
| LFM2.5-230M | #189 | lfm2-5-230m | LiquidAI | 25.41 | percent |
| Granite-4.0-350M | #190 | granite-4-0-350m | IBM | 23.7 | percent |
One best compatible score per canonical product · higher is better
| Rank | Model | Weights | Evidence | Score |
|---|---|---|---|---|
| 01 | Sakana FuguSakana AI | Closed weights | Source carrier | 95.5% |
| 02 | Sakana Fugu-UltraSakana AI | Closed weights | Source carrier | 95.5% |
| 03 | Grok 4.6xAI | Closed weights | Direct source result | 94.9% |
| 04 | GPT-5.4OpenAI | Closed weights | Public reference | 94.6% |
| 05 | GPT-5.6 SolOpenAI | Closed weights | Source carrier | 94.6% |
| 06 | Claude Opus 4.7Anthropic | Closed weights | Source carrier | 94.2% |
| 07 | Gemini 3.1 Pro PreviewGoogle | Closed weights | Public reference | 94.1% |
| 08 | Gemini 3.6 FlashGoogle | Closed weights | Direct source result | 94.1% |
| 09 | Claude Mythos 5Anthropic | Closed weights | Source carrier | 94.1% |
| 10 | GPT-5.5OpenAI | Closed weights | Direct source result | 94.0% |
Each distinct published measurement is retained. Same-snapshot canonical and configuration projections appear once.
| Published model / configuration | Score | Evidence & protocol | Source & dates |
|---|---|---|---|
Qwen3.8-Flash-Next (Artificial Analysis independent run)Qwen3.8-Flash-NextExact identityqwen-3-8-flash-next-aa-unspecified Canonical product: qwen-3-8-flash-next | 92.3% | Public referenceindependently-verifiedVersion & systemdiamond Artificial Analysis GPQA Diamond evaluation | Qwen3.8-Flash-Next individual evaluationsObserved Checked |
Claude Opus 4.7 (Adaptive Reasoning, Max Effort) (Artificial Analysis independent run)Claude Opus 4.7Exact identityclaude-opus-4-7-max Canonical product: claude-opus-4-7 | 91.4% | Direct source resultindependently-verifiedVersion & systemdiamond Artificial Analysis GPQA Diamond evaluation | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) individual evaluationsObserved Checked |
Claude Opus 4.6 (Adaptive Reasoning, Max Effort) (Artificial Analysis independent run)Claude Opus 4.6Exact identityclaude-opus-4-6-max Canonical product: claude-opus-4-6 | 89.6% | Public referenceindependently-verifiedVersion & systemdiamond Artificial Analysis GPQA Diamond evaluation | Claude Opus 4.6 (Adaptive Reasoning, Max Effort) individual evaluationsObserved Checked |
GLM-5.2 (max) (Artificial Analysis independent run)GLM-5.2Exact identityglm-5-2-max Canonical product: glm-5-2 | 89.5% | Direct source resultindependently-verifiedVersion & systemdiamond Artificial Analysis GPQA Diamond evaluation | GLM-5.2 (max) individual evaluationsObserved Checked |
Qwen3.5 397B A17B (Reasoning) (Artificial Analysis completed independent run)Qwen3.5 397B A17BExact identityqwen3-5-397b-thinking Canonical product: qwen3-5-397b | 89.3% | Direct source resultindependently-verifiedVersion & systemdiamond Artificial Analysis GPQA Diamond evaluation | Qwen3.5 397B A17B (Reasoning) current model and individual-evaluation pageObserved Checked |
Kimi K2.5 (Reasoning) (Artificial Analysis completed independent run)Kimi K2.5Exact identitykimi-k2-5-thinking Canonical product: kimi-k2-5 | 87.9% | Direct source resultindependently-verifiedVersion & systemdiamond Artificial Analysis GPQA Diamond evaluation | Kimi K2.5 (Reasoning) current model and individual-evaluation pageObserved Checked |
Qwen3.5 122B A10B (Reasoning) (Artificial Analysis completed independent run)Qwen3.5-122B-A10BExact identityqwen3-5-122b-a10b-aa-reasoning-default Canonical product: qwen3-5-122b-a10b | 85.7% | Direct source resultindependently-verifiedVersion & systemdiamond Artificial Analysis GPQA Diamond evaluation | Qwen3.5 122B A10B (Reasoning) current model and individual-evaluation pageObserved Checked |
Qwen3.6 35B A3B (Reasoning) (Artificial Analysis completed independent run)Qwen3.6-35B-A3BExact identityqwen3-6-35b-a3b-aa-reasoning-default Canonical product: qwen3-6-35b-a3b | 84.1% | Direct source resultindependently-verifiedVersion & systemdiamond Artificial Analysis GPQA Diamond evaluation | Qwen3.6 35B A3B (Reasoning) current model and individual-evaluation pageObserved Checked |
Gemma 4 26B A4B (Reasoning) (Artificial Analysis completed independent run)Gemma 4 26B A4BExact identitygemma-4-26b-a4b-aa-reasoning-default Canonical product: gemma-4-26b-a4b | 79.2% | Direct source resultindependently-verifiedVersion & systemdiamond Artificial Analysis GPQA Diamond evaluation | Gemma 4 26B A4B (Reasoning) current model and individual-evaluation pageObserved Checked |
LongCat 2.0 (Artificial Analysis independent run)LongCat-2.0Exact identitylongcat-2-0-default Canonical product: longcat-2-0 | 78.0% | Direct source resultindependently-verifiedVersion & systemdiamond Artificial Analysis GPQA Diamond evaluation | LongCat 2.0 individual evaluationsObserved Checked |
| Model | Result | Execution & attribution | Original source |
|---|---|---|---|
| Qwen3.8 Max (0902)gpqa · exact AA profile b112af07-3bd5-4647-b09f-b23204361bb2 | 92.828percent | AA current published profile; effort label not exportedindependent evaluatorRetained as additional evidence. Existing Core point is unchanged pending an accepted complete own-evidence amendment; incompatible versions remain separate. | Artificial Analysis ↗Publication date not recorded · checked 2026-09-16 |
From result to context
The Diamond subset of a graduate-level, expert-written question-answering benchmark.
The summary shows one best compatible source result per canonical product. Versions, effort settings and execution systems remain attached to the underlying records.
Scores from different versions or harnesses may not be interchangeable. The published source rows preserve those distinctions and their original units. A source result is not automatically an input to a current index.
A reviewed track from this benchmark is represented in the following current indices. Each index applies its own protocol and eligibility rules.
Contamination risk: Unknown. Lifecycle: Active.