A task with its own rules.
A broad expert-level academic benchmark covering difficult questions across many domains.
- Organisation
- Center for AI Safety and Scale AI
- Version
- Current / rolling
Reasoning / Benchmark profile
A broad expert-level academic benchmark covering difficult questions across many domains.
Observed results
20 ranked models · higher is better · labels show rank and score
| Model | Rank | Model ID | Provider | Score | Unit |
|---|---|---|---|---|---|
| Claude Opus 5 | #1 | claude-opus-5 | Anthropic | 64.7 | percent |
| Claude Mythos 5 | #2 | claude-mythos-5 | Anthropic | 64.5 | percent |
| Muse Spark 1.1 | #3 | muse-spark-1-1 | Meta | 62.1 | percent |
| GPT-5.4 | #4 | gpt-5-4 | OpenAI | 58.7 | percent |
| Claude Opus 4.8 | #5 | claude-opus-4-8 | Anthropic | 57.9 | percent |
| Claude Sonnet 5 | #6 | claude-sonnet-5 | Anthropic | 57.4 | percent |
| GPT-5.5 | #7 | gpt-5-5 | OpenAI | 57.2 | percent |
| Kimi K3 | #8 | kimi-k3 | Moonshot AI | 56 | percent |
| Claude Fable 5 | #9 | claude-fable-5 | Anthropic | 55.468025949953706 | percent |
| GLM-5.3-Flash | #10 | glm-5-3-flash | Z.AI | 55.3 | percent |
| Claude Opus 4.7 | #11 | claude-opus-4-7 | Anthropic | 54.7 | percent |
| GLM-5.2 | #12 | glm-5-2 | Z.AI | 54.7 | percent |
| Hy3 | #13 | hy3 | Tencent | 53.2 | percent |
| Claude Opus 4.6 | #14 | claude-opus-4-6 | Anthropic | 53 | percent |
| GLM-5.1 | #15 | glm-5-1 | Z.AI | 52.3 | percent |
| GLM-5 | #16 | glm-5 | Z.AI | 50.4 | percent |
| Muse Spark | #17 | muse-spark | Meta | 50.4 | percent |
| GPT-5.6 Sol | #18 | gpt-5-6-sol | OpenAI | 49.4902687673772 | percent |
| Claude Sonnet 4.6 | #19 | claude-sonnet-4-6 | Anthropic | 49 | percent |
| MiMo-V2.5-Pro | #20 | mimo-v2-5-pro | Xiaomi | 48 | percent |
| Inkling-Small | #21 | inkling-small | Thinking Machines Lab | 47.8 | percent |
| Agents-A1 | #22 | agents-a1 | InternScience | 47.6 | percent |
| Inkling | #23 | inkling | Thinking Machines Lab | 46 | percent |
| Muse Spark 1.2 | #24 | muse-spark-1-2 | Meta | 45.4587581093605 | percent |
| Gemini 3.1 Pro Preview | #25 | gemini-3-1-pro-preview | 44.72 | percent | |
| Qwen3.8 Max | #26 | qwen-3-8-max | Alibaba Cloud | 43.6 | percent |
| GPT-5.6 Terra | #27 | gpt-5-6-terra | OpenAI | 42.9101019462465 | percent |
| Grok 4.6 | #28 | grok-4-6 | xAI | 42.9101019462465 | percent |
| Grok 4.5 | #29 | grok-4-5 | xAI | 42.678405931418 | percent |
| GLM-5.3 | #30 | glm-5-3 | Z.AI | 42.2613531047266 | percent |
| GPT-5.4 mini | #31 | gpt-5-4-mini | OpenAI | 41.5 | percent |
| Qwen3.7-Max | #32 | qwen-3-7-max | Alibaba Cloud | 41.4 | percent |
| DeepSeek V4 Pro 0813 | #33 | deepseek-v4-pro-0813 | DeepSeek | 41.0101946246525 | percent |
| Gemini 3.6 Flash | #34 | gemini-3-6-flash | 40.8248378127896 | percent | |
| Gemini 3.5 Flash | #35 | gemini-3-5-flash | 40.2 | percent | |
| GPT-5.3-Codex | #36 | gpt-5-3-codex | OpenAI | 39.9 | percent |
| GPT-5.6 Luna | #37 | gpt-5-6-luna | OpenAI | 39.4810009267841 | percent |
| Gemini 3.7 Flash | #38 | gemini-3-7-flash | 38.9712696941613 | percent | |
| Qwen3.8-Flash-Next | #39 | qwen-3-8-flash-next | Alibaba Cloud | 38.044485634847 | percent |
| DeepSeek V4 Pro | #40 | deepseek-v4-pro | DeepSeek | 37.7 | percent |
| GPT-5.4 nano | #41 | gpt-5-4-nano | OpenAI | 37.7 | percent |
| MiniMax M3 | #42 | minimax-m3 | MiniMax | 37.12 | percent |
| Kimi K2.6 | #43 | kimi-k2-6 | Moonshot AI | 35.9129 | percent |
| GPT-5.2 | #44 | gpt-5-2 | OpenAI | 35.4495 | percent |
| Grok 4.3 | #45 | grok-4-3 | xAI | 35.03 | percent |
| DeepSeek V4 Flash | #46 | deepseek-v4-flash | DeepSeek | 34.8 | percent |
| Qwen3.7-Plus | #47 | qwen-3-7-plus | Alibaba Cloud | 34.7 | percent |
| DeepSeek V4 Flash Vision Exp | #48 | deepseek-v4-flash-vision-exp | DeepSeek | 34.4763670064875 | percent |
| LongCat-2.0 | #49 | longcat-2-0 | Meituan | 33.68860055607 | percent |
| GPT-5.2 Codex | #50 | gpt-5-2-codex | OpenAI | 33.5 | percent |
| Kimi K2.7 Code | #51 | kimi-k2-7-code | Moonshot AI | 32.8 | percent |
| Grok 4.20 | #52 | grok-4-20 | xAI | 32.2057 | percent |
| Claude Opus 4.5 | #53 | claude-opus-4-5 | Anthropic | 30.8 | percent |
| Qwen3.8-27B | #54 | qwen-3-8-27b | Alibaba Cloud | 30.8 | percent |
| Kimi K2.5 | #55 | kimi-k2-5 | Moonshot AI | 30.722891566265 | percent |
| Qwen3.5 397B A17B | #56 | qwen3-5-397b | Alibaba Cloud | 28.962001853568 | percent |
| Qwen 3.6 Max (preview) | #57 | qwen3-6-max-preview | Alibaba Cloud | 28.9 | percent |
| Qwen3.6 Max | #58 | qwen3-6-max | Alibaba Cloud | 28.8693 | percent |
| Qwen3.6 Plus | #59 | qwen3-6-plus | Alibaba Cloud | 28.8 | percent |
| Solar Open 2 250B | #60 | solar-open2-250b | Upstage | 28.8 | percent |
| Claude Opus 4.5 Thinking | #61 | claude-opus-4-5-thinking | Anthropic | 28.4 | percent |
| MiMo-V2-Pro | #62 | mimo-v2-pro | Xiaomi | 28.3 | percent |
| MiniMax M2.7 | #63 | minimax-m2-7 | MiniMax | 28.1 | percent |
| Nemotron 3 Ultra | #64 | nemotron-3-ultra | NVIDIA | 26.7 | percent |
| GPT-5 | #65 | gpt-5 | OpenAI | 26.506 | percent |
| Gemma 4 31B | #66 | gemma-4-31b | 26.5 | percent | |
| GPT-5.1 | #67 | gpt-5-1 | OpenAI | 26.5 | percent |
| Qwen3 Max | #68 | qwen3-max | Alibaba Cloud | 26.1816 | percent |
| GPT-5 Codex | #69 | gpt-5-codex | OpenAI | 25.5792 | percent |
| Hy3 Preview | #70 | hy3-preview | Tencent | 25.5 | percent |
| GLM-5-Turbo | #71 | glm-5-turbo | Z.AI | 25.4 | percent |
| Qwen3.5-122B-A10B | #72 | qwen3-5-122b-a10b | Alibaba Cloud | 25.208526413346 | percent |
| MiMo-V2.5 | #73 | mimo-v2-5 | Xiaomi | 25.1622 | percent |
| GLM-4.7 | #74 | glm-4-7 | Z.AI | 25.1158 | percent |
| Qwen3.6 27B | #75 | qwen3-6-27b | Alibaba Cloud | 24 | percent |
| Grok 4 | #76 | grok-4 | xAI | 23.911 | percent |
| Qwen3.5 122B | #77 | qwen3-5-122b | Alibaba Cloud | 23.4476 | percent |
| GPT-5.1-Codex | #78 | gpt-5-1-codex | OpenAI | 23.4 | percent |
| GPT-5.1-Codex-Max | #79 | gpt-5-1-codex-max | OpenAI | 23.4 | percent |
| Kimi K2 Thinking | #80 | kimi-k2-thinking | Moonshot AI | 22.3355 | percent |
| Qwen3.6-35B-A3B | #81 | qwen3-6-35b-a3b | Alibaba Cloud | 22.24281742354 | percent |
| DeepSeek V3.2 | #82 | deepseek-v3-2 | DeepSeek | 22.2428 | percent |
| Qwen3.5 27B | #83 | qwen3-5-27b | Alibaba Cloud | 22.2 | percent |
| MiniMax M2.1 | #84 | minimax-m2-1 | MiniMax | 22.1965 | percent |
| Muse Glimmer 30B | #85 | muse-glimmer-30b | Meta | 22 | percent |
| Gemini 2.5 Pro | #86 | gemini-2-5-pro | 21.0843 | percent | |
| o3 | #87 | o3 | OpenAI | 20.0447 | percent |
| MiMo-V2-Omni | #88 | mimo-v2-omni | Xiaomi | 19.9 | percent |
| Step 3.7 Flash | #89 | step-3-7-flash | StepFun | 19.9 | percent |
| Qwen3.5 35B | #90 | qwen3-5-35b | Alibaba Cloud | 19.7405 | percent |
| Qwen3.5-35B-A3B | #91 | qwen3-5-35b-a3b | Alibaba Cloud | 19.7 | percent |
| Gemma 4 26B A4B | #92 | gemma-4-26b-a4b | 19.323447636701 | percent | |
| Nemotron 3 Super | #93 | nemotron-3-super | NVIDIA | 19.1844 | percent |
| MiniMax M2.5 | #94 | minimax-m2-5 | MiniMax | 19.1381 | percent |
| GPT-OSS 120B | #95 | gpt-oss-120b | OpenAI | 18.5 | percent |
| Gemma 4 26B | #96 | gemma-4-26b | 18.2576 | percent | |
| Grok 4.1 Fast (Reasoning) | #97 | grok-4-1-fast-reasoning | xAI | 17.6 | percent |
| o4-mini | #98 | o4-mini | OpenAI | 17.5112 | percent |
| Gemini 3.5 Flash-Lite | #99 | gemini-3-5-flash-lite | 17.5 | percent | |
| Claude Sonnet 4.5 | #100 | claude-sonnet-4-5 | Anthropic | 17.2845 | percent |
| Grok 4 Fast (Reasoning) | #101 | grok-4-fast-reasoning | xAI | 17 | percent |
| Grok 4 Fast | #102 | grok-4-fast | xAI | 16.9601 | percent |
| Gemini 3.1 Flash-Lite | #103 | gemini-3-1-flash-lite | 16.2 | percent | |
| Trinity-Large-Thinking | #104 | trinity-large-thinking | Arcee AI | 15.848007414272 | percent |
| GLM-5V-Turbo | #105 | glm-5v-turbo | Z.AI | 15.8 | percent |
| DeepSeek V3.1 Terminus | #106 | deepseek-v3-1-terminus | DeepSeek | 15.2456 | percent |
| DeepSeek-R1 | #107 | deepseek-r1 | DeepSeek | 14.9 | percent |
| Gemma 4 12B Unified | #108 | gemma-4-12b | 14.8 | percent | |
| Trinity-Large-Preview | #109 | trinity-large-preview | Arcee AI | 14.7 | percent |
| GPT-5 mini | #110 | gpt-5-mini | OpenAI | 14.5968 | percent |
| DeepSeek V3.1 | #111 | deepseek-v3-1 | DeepSeek | 14.272474513438 | percent |
| Gemini 3 Flash | #112 | gemini-3-flash | 14.1 | percent | |
| Qwen3.5 Omni Plus | #113 | qwen3-5-omni-plus | Alibaba Cloud | 13.9018 | percent |
| Mistral Medium 3.5 128B | #114 | mistral-medium-3-5-128b | Mistral AI | 13.762743280816 | percent |
| GLM-4.6 | #115 | glm-4-6 | Z.AI | 13.3457 | percent |
| K-Exaone | #116 | k-exaone | LG AI Research | 13.1 | percent |
| Mistral Medium 3.5 | #117 | mistral-medium-3-5 | Mistral AI | 12.79 | percent |
| Gemini 2.5 Flash | #118 | gemini-2-5-flash | 12.7433 | percent | |
| MiniMax M2 | #119 | minimax-m2 | MiniMax | 12.4652 | percent |
| Claude 4.1 Opus Thinking | #120 | claude-4-1-opus-thinking | Anthropic | 11.9 | percent |
| Claude Opus 4.1 | #121 | claude-opus-4-1 | Anthropic | 11.8911 | percent |
| Claude Opus 4 | #122 | claude-opus-4 | Anthropic | 11.6775 | percent |
| Command A+ | #123 | command-a-plus | Cohere | 11.4 | percent |
| Nemotron 3 Nano 30B | #124 | nemotron-3-nano-30b | NVIDIA | 11.399443929564 | percent |
| Grok 3 mini | #125 | grok-3-mini | xAI | 11.0656 | percent |
| Claude Sonnet 3.7 | #126 | claude-sonnet-3-7 | Anthropic | 10.2832 | percent |
| Sarvam 105B | #127 | sarvam-105b | Sarvam | 10.1 | percent |
| Mistral Small 4 | #128 | mistral-small-4 | Mistral AI | 9.870250231696 | percent |
| GPT-OSS 20B | #129 | gpt-oss-20b | OpenAI | 9.8 | percent |
| Claude Sonnet 4 | #130 | claude-sonnet-4 | Anthropic | 9.5922 | percent |
| Nova 2 Pro | #131 | nova-2-pro | Amazon | 8.9435 | percent |
| o3-mini | #132 | o3-mini | OpenAI | 8.7 | percent |
| Ling 2.6 1T | #133 | ling-2-6-1t | InclusionAI | 8.2484 | percent |
| Nemotron Ultra 253B | #134 | nemotron-ultra-253b | NVIDIA | 8.1 | percent |
| o1 | #135 | o1 | OpenAI | 7.7496 | percent |
| Grok Code Fast 1 | #136 | grok-code-fast-1 | xAI | 7.5 | percent |
| Kimi K2 | #137 | kimi-k2 | Moonshot AI | 7 | percent |
| Sarvam 30B | #138 | sarvam-30b | Sarvam | 7 | percent |
| LFM2.5-8B-A1B | #139 | lfm2-5-8b-a1b | LiquidAI | 6.9 | percent |
| GLM-4.5-Air | #140 | glm-4-5-air | Z.AI | 6.8 | percent |
| Granite-4.0-H-350M | #141 | granite-4-0-h-350m | IBM | 6.4 | percent |
| Kimi K2 0905 | #142 | kimi-k2-0905 | Moonshot AI | 6.3485 | percent |
| Ling 2.6 Flash | #143 | ling-2-6-flash | InclusionAI | 6.2 | percent |
| Exaone 4.0 1.2B | #144 | exaone-4-0-1-2b | LG AI Research | 5.8 | percent |
| Granite-4.0-350M | #145 | granite-4-0-350m | IBM | 5.7 | percent |
| DeepSeek R1 Distill Qwen 32B | #146 | deepseek-r1-distill-qwen-32b | DeepSeek | 5.5 | percent |
| Nemotron 3 Nano Omni 30B A3B | #147 | nemotron-3-nano-omni-30b-a3b | NVIDIA | 5.3 | percent |
| Granite-4.0-1B | #148 | granite-4-0-1b | IBM | 5.1 | percent |
| LFM2.5-VL-1.6B-Extract | #149 | lfm2-5-vl-1-6b-extract | LiquidAI | 5.1 | percent |
| GPT-4.1 mini | #150 | gpt-4-1-mini | OpenAI | 5.02 | percent |
| Granite-4.0-H-1B | #151 | granite-4-0-h-1b | IBM | 5 | percent |
| Grok 4.1 Fast | #152 | grok-4-1-fast | xAI | 5 | percent |
| Llama 4 Maverick | #153 | llama-4-maverick | Meta | 4.911955514365 | percent |
| Exaone 4.0 32B | #154 | exaone-4-0-32b | LG AI Research | 4.9 | percent |
| Gemini 1.5 Pro | #155 | gemini-1-5-pro | 4.9 | percent | |
| Gemma 4 E2B | #156 | gemma-4-e2b | 4.8 | percent | |
| Gemma 3 27B | #157 | gemma-3-27b | 4.7 | percent | |
| Gemini 1.0 Pro | #158 | gemini-1-0-pro | 4.6 | percent | |
| GPT-4.1 | #159 | gpt-4-1 | OpenAI | 4.6 | percent |
| Llama 4 Scout | #160 | llama-4-scout | Meta | 4.3 | percent |
| Mistral Medium 3 | #161 | mistral-medium-3 | Mistral AI | 4.3 | percent |
| Claude Haiku 4.5 | #162 | claude-haiku-4-5 | Anthropic | 4.26 | percent |
| Llama 3.1 405B | #163 | llama-3-1-405b | Meta | 4.2 | percent |
| Mistral Large 3 | #164 | mistral-large-3 | Mistral AI | 4.1 | percent |
| Phi-4 | #165 | phi-4 | Microsoft | 4.1 | percent |
| Claude 4 Sonnet | #166 | claude-4-sonnet | Anthropic | 4 | percent |
| GPT-4o mini | #167 | gpt-4o-mini | OpenAI | 4 | percent |
| Mistral Large 2 | #168 | mistral-large-2 | Mistral AI | 4 | percent |
| Claude 3 Haiku | #169 | claude-3-haiku | Anthropic | 3.9 | percent |
| GPT-4.1 nano | #170 | gpt-4-1-nano | OpenAI | 3.9 | percent |
| Qwen2.5 Coder 32B Instruct | #171 | qwen2-5-coder-32b-instruct | Alibaba Cloud | 3.8 | percent |
| Solar Pro 2 | #172 | solar-pro-2 | Upstage | 3.8 | percent |
| Gemma 4 E4B | #173 | gemma-4-e4b | 3.7 | percent | |
| DeepSeek V3 | #174 | deepseek-v3 | DeepSeek | 3.6 | percent |
| Nova Pro | #175 | nova-pro | Amazon | 3.4 | percent |
| GPT-4 Turbo | #176 | gpt-4-turbo | OpenAI | 3.3 | percent |
| GPT-4o | #177 | gpt-4o | OpenAI | 3.3 | percent |
| Claude 3 Opus | #178 | claude-3-opus | Anthropic | 3.1 | percent |
One best compatible score per canonical product · higher is better
| Rank | Model | Weights | Evidence | Score |
|---|---|---|---|---|
| 01 | Claude Opus 5Anthropic | Closed weights | Direct source result | 64.7% |
| 02 | Claude Mythos 5Anthropic | Closed weights | Source carrier | 64.5% |
| 03 | Muse Spark 1.1Meta | Closed weights | Direct source result | 62.1% |
| 04 | GPT-5.4OpenAI | Closed weights | Source carrier | 58.7% |
| 05 | Claude Opus 4.8Anthropic | Closed weights | Source carrier | 57.9% |
| 06 | Claude Sonnet 5Anthropic | Closed weights | Source carrier | 57.4% |
| 07 | GPT-5.5OpenAI | Closed weights | Source carrier | 57.2% |
| 08 | Kimi K3Moonshot AI | Open weights | Direct source result | 56% |
| 09 | Claude Fable 5Anthropic | Closed weights | Direct source result | 55.5% |
| 10 | GLM-5.3-FlashZ.AI | Open weights | Public reference | 55.3% |
Each distinct published measurement is retained. Same-snapshot canonical and configuration projections appear once.
| Published model / configuration | Score | Evidence & protocol | Source & dates |
|---|---|---|---|
Claude Opus 4.7 (Adaptive Reasoning, Max Effort) (Artificial Analysis independent run)Claude Opus 4.7Exact identityclaude-opus-4-7-max Canonical product: claude-opus-4-7 | 42.3% | Direct source resultindependently-verifiedVersion & systemtext-only current Artificial Analysis text-only HLE evaluation | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) individual evaluationsObserved Checked |
GLM-5.2 (max) (Artificial Analysis independent run)GLM-5.2Exact identityglm-5-2-max Canonical product: glm-5-2 | 41.1% | Direct source resultindependently-verifiedVersion & systemtext-only current Artificial Analysis text-only HLE evaluation | GLM-5.2 (max) individual evaluationsObserved Checked |
Claude Opus 4.6 (Adaptive Reasoning, Max Effort) (Artificial Analysis independent run)Claude Opus 4.6Exact identityclaude-opus-4-6-max Canonical product: claude-opus-4-6 | 39.9% | Public referenceindependently-verifiedVersion & systemtext-only current Artificial Analysis text-only HLE evaluation | Claude Opus 4.6 (Adaptive Reasoning, Max Effort) individual evaluationsObserved Checked |
Qwen3.8-Flash-Next (Artificial Analysis independent run)Qwen3.8-Flash-NextExact identityqwen-3-8-flash-next-aa-unspecified Canonical product: qwen-3-8-flash-next | 38.0% | Public referenceindependently-verifiedVersion & systemtext-only current Artificial Analysis text-only HLE evaluation | Qwen3.8-Flash-Next individual evaluationsObserved Checked |
LongCat 2.0 (Artificial Analysis independent run)LongCat-2.0Exact identitylongcat-2-0-default Canonical product: longcat-2-0 | 33.7% | Direct source resultindependently-verifiedVersion & systemtext-only current Artificial Analysis text-only HLE evaluation | LongCat 2.0 individual evaluationsObserved Checked |
Kimi K2.5 (Reasoning) (Artificial Analysis completed independent run)Kimi K2.5Exact identitykimi-k2-5-thinking Canonical product: kimi-k2-5 | 30.7% | Direct source resultindependently-verifiedVersion & systemtext-only current Artificial Analysis text-only HLE evaluation | Kimi K2.5 (Reasoning) current model and individual-evaluation pageObserved Checked |
Qwen3.5 397B A17B (Reasoning) (Artificial Analysis completed independent run)Qwen3.5 397B A17BExact identityqwen3-5-397b-thinking Canonical product: qwen3-5-397b | 29.0% | Direct source resultindependently-verifiedVersion & systemtext-only current Artificial Analysis text-only HLE evaluation | Qwen3.5 397B A17B (Reasoning) current model and individual-evaluation pageObserved Checked |
Qwen3.5 122B A10B (Reasoning) (Artificial Analysis completed independent run)Qwen3.5-122B-A10BExact identityqwen3-5-122b-a10b-aa-reasoning-default Canonical product: qwen3-5-122b-a10b | 25.2% | Direct source resultindependently-verifiedVersion & systemtext-only current Artificial Analysis text-only HLE evaluation | Qwen3.5 122B A10B (Reasoning) current model and individual-evaluation pageObserved Checked |
Qwen3.6 35B A3B (Reasoning) (Artificial Analysis completed independent run)Qwen3.6-35B-A3BExact identityqwen3-6-35b-a3b-aa-reasoning-default Canonical product: qwen3-6-35b-a3b | 22.2% | Direct source resultindependently-verifiedVersion & systemtext-only current Artificial Analysis text-only HLE evaluation | Qwen3.6 35B A3B (Reasoning) current model and individual-evaluation pageObserved Checked |
Gemma 4 26B A4B (Reasoning) (Artificial Analysis completed independent run)Gemma 4 26B A4BExact identitygemma-4-26b-a4b-aa-reasoning-default Canonical product: gemma-4-26b-a4b | 19.3% | Direct source resultindependently-verifiedVersion & systemtext-only current Artificial Analysis text-only HLE evaluation | Gemma 4 26B A4B (Reasoning) current model and individual-evaluation pageObserved Checked |
| Model | Result | Execution & attribution | Original source |
|---|---|---|---|
| Qwen3.8 Max (0902)hle · exact AA profile b112af07-3bd5-4647-b09f-b23204361bb2 | 43.095percent | AA current published profile; effort label not exportedindependent evaluatorRetained as additional evidence. Existing Core point is unchanged pending an accepted complete own-evidence amendment; incompatible versions remain separate. | Artificial Analysis ↗Publication date not recorded · checked 2026-09-16 |
From result to context
A broad expert-level academic benchmark covering difficult questions across many domains.
The summary shows one best compatible source result per canonical product. Versions, effort settings and execution systems remain attached to the underlying records.
Scores from different versions or harnesses may not be interchangeable. The published source rows preserve those distinctions and their original units. A source result is not automatically an input to a current index.
A reviewed track from this benchmark is represented in the following current indices. Each index applies its own protocol and eligibility rules.
Contamination risk: Unknown. Lifecycle: Rolling.