A task with its own rules.
Artificial Analysis long-context reasoning benchmark measuring extraction and synthesis over documents from roughly 10k to 100k tokens.
- Organisation
- Artificial Analysis
- Version
- Current / rolling
Reasoning / Benchmark profile
Artificial Analysis long-context reasoning benchmark measuring extraction and synthesis over documents from roughly 10k to 100k tokens.
Observed results
20 ranked models · higher is better · labels show rank and score
| Model | Rank | Model ID | Provider | Score | Unit |
|---|---|---|---|---|---|
| Muse Spark 1.2 | #1 | muse-spark-1-2 | Meta | 83.3333333333333 | percent |
| Kimi K3 | #2 | kimi-k3 | Moonshot AI | 82.6666666666667 | percent |
| Muse Spark 1.1 | #3 | muse-spark-1-1 | Meta | 81.3333333333333 | percent |
| Gemini 3.7 Flash | #4 | gemini-3-7-flash | 81 | percent | |
| Muse Glimmer 30B | #5 | muse-glimmer-30b | Meta | 80 | percent |
| GPT-5.6 Terra | #6 | gpt-5-6-terra | OpenAI | 79.6666666666667 | percent |
| Gemini 3.6 Flash | #7 | gemini-3-6-flash | 79 | percent | |
| GPT-5.5 | #8 | gpt-5-5 | OpenAI | 79 | percent |
| GPT-5.6 Luna | #9 | gpt-5-6-luna | OpenAI | 78.3333333333333 | percent |
| DeepSeek V4 Flash Vision Exp | #10 | deepseek-v4-flash-vision-exp | DeepSeek | 78 | percent |
| GLM-5.3-Flash | #11 | glm-5-3-flash | Z.AI | 78 | percent |
| GPT-5.4 | #12 | gpt-5-4 | OpenAI | 77.6666666666667 | percent |
| GPT-5.6 Sol | #13 | gpt-5-6-sol | OpenAI | 77.6666666666667 | percent |
| Claude Sonnet 5 | #14 | claude-sonnet-5 | Anthropic | 77 | percent |
| Qwen3.8-Flash-Next | #15 | qwen-3-8-flash-next | Alibaba Cloud | 77 | percent |
| GLM-5.2 | #16 | glm-5-2 | Z.AI | 76.666666666667 | percent |
| Claude Fable 5 | #17 | claude-fable-5 | Anthropic | 76.6666666666667 | percent |
| GLM-5.3 | #18 | glm-5-3 | Z.AI | 76.3333333333333 | percent |
| GPT-5.2 Codex | #19 | gpt-5-2-codex | OpenAI | 75.7 | percent |
| Claude Opus 5 | #20 | claude-opus-5 | Anthropic | 75.6666666666667 | percent |
| GPT-5 | #21 | gpt-5 | OpenAI | 75.6 | percent |
| DeepSeek V4 Pro 0813 | #22 | deepseek-v4-pro-0813 | DeepSeek | 75.3333333333333 | percent |
| Claude Opus 4.7 | #23 | claude-opus-4-7 | Anthropic | 75.333333333333 | percent |
| GPT-5.1 | #24 | gpt-5-1 | OpenAI | 75 | percent |
| Grok 4.6 | #25 | grok-4-6 | xAI | 75 | percent |
| Claude Opus 4.6 | #26 | claude-opus-4-6 | Anthropic | 74.333333333333 | percent |
| Claude Opus 4.5 | #27 | claude-opus-4-5 | Anthropic | 74 | percent |
| Claude Opus 4.5 Thinking | #28 | claude-opus-4-5-thinking | Anthropic | 74 | percent |
| GPT-5.3-Codex | #29 | gpt-5-3-codex | OpenAI | 74 | percent |
| Grok 4.5 | #30 | grok-4-5 | xAI | 74 | percent |
| MiniMax M3 | #31 | minimax-m3 | MiniMax | 74 | percent |
| MiMo-V2.5-Pro | #32 | mimo-v2-5-pro | Xiaomi | 73.3333 | percent |
| Claude Opus 4.8 | #33 | claude-opus-4-8 | Anthropic | 73 | percent |
| Kimi K2.5 | #34 | kimi-k2-5 | Moonshot AI | 73 | percent |
| GPT-5.2 | #35 | gpt-5-2 | OpenAI | 72.7 | percent |
| Gemini 3.1 Pro Preview | #36 | gemini-3-1-pro-preview | 72.6667 | percent | |
| Qwen3.5 397B A17B | #37 | qwen3-5-397b | Alibaba Cloud | 72.666666666667 | percent |
| Claude Sonnet 4.6 | #38 | claude-sonnet-4-6 | Anthropic | 70.6667 | percent |
| Qwen3.5-122B-A10B | #39 | qwen3-5-122b-a10b | Alibaba Cloud | 70.333333333333 | percent |
| Claude Haiku 4.5 | #40 | claude-haiku-4-5 | Anthropic | 70.3333 | percent |
| Kimi K2.6 | #41 | kimi-k2-6 | Moonshot AI | 69.7 | percent |
| Muse Spark | #42 | muse-spark | Meta | 69.7 | percent |
| Qwen 3.6 Max (preview) | #43 | qwen3-6-max-preview | Alibaba Cloud | 69.7 | percent |
| Qwen3.6 Plus | #44 | qwen3-6-plus | Alibaba Cloud | 69.7 | percent |
| Qwen3.6 Max | #45 | qwen3-6-max | Alibaba Cloud | 69.6667 | percent |
| Gemini 3.5 Flash | #46 | gemini-3-5-flash | 69.3333 | percent | |
| GPT-5.4 mini | #47 | gpt-5-4-mini | OpenAI | 69.3333 | percent |
| o3 | #48 | o3 | OpenAI | 69.3333 | percent |
| GPT-5 Codex | #49 | gpt-5-codex | OpenAI | 69 | percent |
| Qwen3.7-Max | #50 | qwen-3-7-max | Alibaba Cloud | 69 | percent |
| MiniMax M2.7 | #51 | minimax-m2-7 | MiniMax | 68.7 | percent |
| Qwen3.6 27B | #52 | qwen3-6-27b | Alibaba Cloud | 68.7 | percent |
| Grok 4 | #53 | grok-4 | xAI | 68 | percent |
| Grok 4.1 Fast (Reasoning) | #54 | grok-4-1-fast-reasoning | xAI | 68 | percent |
| Qwen3.5 27B | #55 | qwen3-5-27b | Alibaba Cloud | 67.3333 | percent |
| GPT-5.1-Codex | #56 | gpt-5-1-codex | OpenAI | 67.3 | percent |
| GPT-5.1-Codex-Max | #57 | gpt-5-1-codex-max | OpenAI | 67.3 | percent |
| Nemotron 3 Ultra | #58 | nemotron-3-ultra | NVIDIA | 67 | percent |
| Hy3 | #59 | hy3 | Tencent | 66.7 | percent |
| Hy3 Preview | #60 | hy3-preview | Tencent | 66.7 | percent |
| MiMo-V2-Omni | #61 | mimo-v2-omni | Xiaomi | 66.7 | percent |
| Qwen3.5 122B | #62 | qwen3-5-122b | Alibaba Cloud | 66.6667 | percent |
| Qwen3.6-35B-A3B | #63 | qwen3-6-35b-a3b | Alibaba Cloud | 66.666666666667 | percent |
| Claude Opus 4.1 | #64 | claude-opus-4-1 | Anthropic | 66.3333 | percent |
| DeepSeek V4 Pro | #65 | deepseek-v4-pro | DeepSeek | 66.3333 | percent |
| Gemini 3 Flash | #66 | gemini-3-flash | 66.3333 | percent | |
| Kimi K2 Thinking | #67 | kimi-k2-thinking | Moonshot AI | 66.3333 | percent |
| Kimi K2.7 Code | #68 | kimi-k2-7-code | Moonshot AI | 66.3333 | percent |
| Claude 4.1 Opus Thinking | #69 | claude-4-1-opus-thinking | Anthropic | 66.3 | percent |
| Gemini 2.5 Pro | #70 | gemini-2-5-pro | 66 | percent | |
| GPT-5 mini | #71 | gpt-5-mini | OpenAI | 66 | percent |
| GPT-5.4 nano | #72 | gpt-5-4-nano | OpenAI | 66 | percent |
| MiniMax M2.5 | #73 | minimax-m2-5 | MiniMax | 66 | percent |
| Qwen3 Max | #74 | qwen3-max | Alibaba Cloud | 66 | percent |
| Claude Sonnet 4.5 | #75 | claude-sonnet-4-5 | Anthropic | 65.6667 | percent |
| Mistral Medium 3.5 128B | #76 | mistral-medium-3-5-128b | Mistral AI | 65.333333333333 | percent |
| Gemini 3.1 Flash-Lite | #77 | gemini-3-1-flash-lite | 65.3333 | percent | |
| DeepSeek V3.1 Terminus | #78 | deepseek-v3-1-terminus | DeepSeek | 65 | percent |
| DeepSeek V3.2 | #79 | deepseek-v3-2 | DeepSeek | 65 | percent |
| Qwen3.7-Plus | #80 | qwen-3-7-plus | Alibaba Cloud | 65 | percent |
| Grok 4 Fast (Reasoning) | #81 | grok-4-fast-reasoning | xAI | 64.7 | percent |
| Claude Sonnet 4 | #82 | claude-sonnet-4 | Anthropic | 64.6667 | percent |
| Grok 4 Fast | #83 | grok-4-fast | xAI | 64.6667 | percent |
| Gemini 2.5 Flash | #84 | gemini-2-5-flash | 64.3333 | percent | |
| Grok 4.3 | #85 | grok-4-3 | xAI | 64.3333 | percent |
| GLM-4.7 | #86 | glm-4-7 | Z.AI | 64 | percent |
| Step 3.7 Flash | #87 | step-3-7-flash | StepFun | 63.7 | percent |
| GLM-5 | #88 | glm-5 | Z.AI | 63.3333 | percent |
| Inkling | #89 | inkling | Thinking Machines Lab | 63.3 | percent |
| DeepSeek V4 Flash | #90 | deepseek-v4-flash | DeepSeek | 63 | percent |
| Qwen3.5-35B-A3B | #91 | qwen3-5-35b-a3b | Alibaba Cloud | 62.7 | percent |
| MiMo-V2.5 | #92 | mimo-v2-5 | Xiaomi | 62.6667 | percent |
| Qwen3.5 35B | #93 | qwen3-5-35b | Alibaba Cloud | 62.6667 | percent |
| LongCat-2.0 | #94 | longcat-2-0 | Meituan | 62.666666666667 | percent |
| GLM-5.1 | #95 | glm-5-1 | Z.AI | 62.3333 | percent |
| Solar Open 2 250B | #96 | solar-open2-250b | Upstage | 62.3 | percent |
| Gemini 3.5 Flash-Lite | #97 | gemini-3-5-flash-lite | 62 | percent | |
| Gemma 4 31B | #98 | gemma-4-31b | 62 | percent | |
| Gemma 4 26B A4B | #99 | gemma-4-26b-a4b | 61.666666666667 | percent | |
| GLM-5V-Turbo | #100 | glm-5v-turbo | Z.AI | 61 | percent |
| GPT-4.1 | #101 | gpt-4-1 | OpenAI | 61 | percent |
| MiniMax M2 | #102 | minimax-m2 | MiniMax | 61 | percent |
| Mistral Medium 3.5 | #103 | mistral-medium-3-5 | Mistral AI | 61 | percent |
| GLM-5-Turbo | #104 | glm-5-turbo | Z.AI | 60.7 | percent |
| MiMo-V2-Pro | #105 | mimo-v2-pro | Xiaomi | 60.7 | percent |
| Claude Sonnet 3.7 | #106 | claude-sonnet-3-7 | Anthropic | 60.6667 | percent |
| Nemotron 3 Super | #107 | nemotron-3-super | NVIDIA | 60 | percent |
| o1 | #108 | o1 | OpenAI | 59.3333 | percent |
| MiniMax M2.1 | #109 | minimax-m2-1 | MiniMax | 59 | percent |
| Grok 4.20 | #110 | grok-4-20 | xAI | 58 | percent |
| DeepSeek V3.1 | #111 | deepseek-v3-1 | DeepSeek | 56.666666666667 | percent |
| K-Exaone | #112 | k-exaone | LG AI Research | 55.7 | percent |
| Gemma 4 26B | #113 | gemma-4-26b | 55.6667 | percent | |
| Gemma 4 12B Unified | #114 | gemma-4-12b | 55.3333 | percent | |
| o4-mini | #115 | o4-mini | OpenAI | 55 | percent |
| DeepSeek-R1 | #116 | deepseek-r1 | DeepSeek | 54.7 | percent |
| GLM-4.6 | #117 | glm-4-6 | Z.AI | 54.3333 | percent |
| Nova 2 Pro | #118 | nova-2-pro | Amazon | 54.3333 | percent |
| Qwen3.5 Omni Plus | #119 | qwen3-5-omni-plus | Alibaba Cloud | 52.6667 | percent |
| Kimi K2 0905 | #120 | kimi-k2-0905 | Moonshot AI | 52.3333 | percent |
| NVIDIA Nemotron 3.5 Lightning 30B-A3B | #121 | nemotron-3-5-lightning-30b-a3b | NVIDIA | 52 | percent |
| Kimi K2 | #122 | kimi-k2 | Moonshot AI | 51 | percent |
| GPT-OSS 120B | #123 | gpt-oss-120b | OpenAI | 50.7 | percent |
| Grok 3 mini | #124 | grok-3-mini | xAI | 50.3333 | percent |
| Llama 4 Maverick | #125 | llama-4-maverick | Meta | 50 | percent |
| Grok Code Fast 1 | #126 | grok-code-fast-1 | xAI | 48.3333 | percent |
| Mistral Small 4 | #127 | mistral-small-4 | Mistral AI | 47.333333333333 | percent |
| Command A+ | #128 | command-a-plus | Cohere | 46 | percent |
| GPT-4.1 mini | #129 | gpt-4-1-mini | OpenAI | 45.333333333333 | percent |
| Claude 4 Sonnet | #130 | claude-4-sonnet | Anthropic | 44.3 | percent |
| GLM-4.5-Air | #131 | glm-4-5-air | Z.AI | 43.7 | percent |
| Trinity-Large-Thinking | #132 | trinity-large-thinking | Arcee AI | 38.333333333333 | percent |
| Nemotron 3 Nano 30B | #133 | nemotron-3-nano-30b | NVIDIA | 37.333333333333 | percent |
| Nemotron 3 Nano Omni 30B A3B | #134 | nemotron-3-nano-omni-30b-a3b | NVIDIA | 35.7 | percent |
| Mistral Large 3 | #135 | mistral-large-3 | Mistral AI | 34.7 | percent |
| Ling 2.6 1T | #136 | ling-2-6-1t | InclusionAI | 34.6667 | percent |
| Claude Opus 4 | #137 | claude-opus-4 | Anthropic | 33.6667 | percent |
| Trinity-Large-Preview | #138 | trinity-large-preview | Arcee AI | 33 | percent |
| Gemma 4 E4B | #139 | gemma-4-e4b | 30.7 | percent | |
| GPT-OSS 20B | #140 | gpt-oss-20b | OpenAI | 30.7 | percent |
| Llama 4 Scout | #141 | llama-4-scout | Meta | 30.333333333333 | percent |
| DeepSeek V3 | #142 | deepseek-v3 | DeepSeek | 29 | percent |
| Mistral Medium 3 | #143 | mistral-medium-3 | Mistral AI | 28 | percent |
| Ling 2.6 Flash | #144 | ling-2-6-flash | InclusionAI | 25 | percent |
| Llama 3.1 405B | #145 | llama-3-1-405b | Meta | 24.3 | percent |
| Grok 4.1 Fast | #146 | grok-4-1-fast | xAI | 22 | percent |
| Claude 3 Haiku | #147 | claude-3-haiku | Anthropic | 21 | percent |
| GPT-4.1 nano | #148 | gpt-4-1-nano | OpenAI | 19.333333333333 | percent |
| Nova Pro | #149 | nova-pro | Amazon | 19 | percent |
| Gemma 4 E2B | #150 | gemma-4-e2b | 15 | percent | |
| DeepSeek R1 Distill Qwen 32B | #151 | deepseek-r1-distill-qwen-32b | DeepSeek | 9.7 | percent |
| Exaone 4.0 32B | #152 | exaone-4-0-32b | LG AI Research | 8 | percent |
| Nemotron Ultra 253B | #153 | nemotron-ultra-253b | NVIDIA | 7.3 | percent |
| Gemma 3 27B | #154 | gemma-3-27b | 6.333333333333 | percent | |
| Granite-4.0-H-1B | #155 | granite-4-0-h-1b | IBM | 6.3 | percent |
| Mistral Large 2 | #156 | mistral-large-2 | Mistral AI | 5.3 | percent |
| Granite-4.0-1B | #157 | granite-4-0-1b | IBM | 4 | percent |
| Exaone 4.0 1.2B | #158 | exaone-4-0-1-2b | LG AI Research | 0 | percent |
| GPT-4o | #159 | gpt-4o | OpenAI | 0 | percent |
| Granite-4.0-350M | #160 | granite-4-0-350m | IBM | 0 | percent |
| Granite-4.0-H-350M | #161 | granite-4-0-h-350m | IBM | 0 | percent |
| LFM2.5-8B-A1B | #162 | lfm2-5-8b-a1b | LiquidAI | 0 | percent |
| LFM2.5-VL-1.6B-Extract | #163 | lfm2-5-vl-1-6b-extract | LiquidAI | 0 | percent |
| Phi-4 | #164 | phi-4 | Microsoft | 0 | percent |
| Sarvam 105B | #165 | sarvam-105b | Sarvam | 0 | percent |
| Sarvam 30B | #166 | sarvam-30b | Sarvam | 0 | percent |
| Solar Pro 2 | #167 | solar-pro-2 | Upstage | 0 | percent |
One best compatible score per canonical product · higher is better
| Rank | Model | Weights | Evidence | Score |
|---|---|---|---|---|
| 01 | Muse Spark 1.2Meta | Open announced | Direct source result | 83.3% |
| 02 | Kimi K3Moonshot AI | Open weights | Direct source result | 82.7% |
| 03 | Muse Spark 1.1Meta | Closed weights | Direct source result | 81.3% |
| 04 | Gemini 3.7 FlashGoogle | Closed weights | Direct source result | 81% |
| 05 | Muse Glimmer 30BMeta | Open weights | Direct source result | 80% |
| 06 | GPT-5.6 TerraOpenAI | Closed weights | Direct source result | 79.7% |
| 07 | Gemini 3.6 FlashGoogle | Closed weights | Direct source result | 79% |
| 08 | GPT-5.5OpenAI | Closed weights | Direct source result | 79% |
| 09 | GPT-5.6 LunaOpenAI | Closed weights | Direct source result | 78.3% |
| 10 | DeepSeek V4 Flash Vision ExpDeepSeek | Not documented | Public reference | 78% |
Each distinct published measurement is retained. Same-snapshot canonical and configuration projections appear once.
| Published model / configuration | Score | Evidence & protocol | Source & dates |
|---|---|---|---|
Qwen3.8-Flash-Next (Artificial Analysis independent run)Qwen3.8-Flash-NextExact identityqwen-3-8-flash-next-aa-unspecified Canonical product: qwen-3-8-flash-next | 77% | Public referenceindependently-verifiedVersion & systemstandard Artificial Analysis AA-LCR evaluation | Qwen3.8-Flash-Next individual evaluationsObserved Checked |
GLM-5.2 (max) (Artificial Analysis independent run)GLM-5.2Exact identityglm-5-2-max Canonical product: glm-5-2 | 76.7% | Direct source resultindependently-verifiedVersion & systemstandard Artificial Analysis AA-LCR evaluation | GLM-5.2 (max) individual evaluationsObserved Checked |
Claude Opus 4.7 (Adaptive Reasoning, Max Effort) (Artificial Analysis independent run)Claude Opus 4.7Exact identityclaude-opus-4-7-max Canonical product: claude-opus-4-7 | 75.3% | Direct source resultindependently-verifiedVersion & systemstandard Artificial Analysis AA-LCR evaluation | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) individual evaluationsObserved Checked |
Claude Opus 4.6 (Adaptive Reasoning, Max Effort) (Artificial Analysis independent run)Claude Opus 4.6Exact identityclaude-opus-4-6-max Canonical product: claude-opus-4-6 | 74.3% | Public referenceindependently-verifiedVersion & systemstandard Artificial Analysis AA-LCR evaluation | Claude Opus 4.6 (Adaptive Reasoning, Max Effort) individual evaluationsObserved Checked |
Kimi K2.5 (Reasoning) (Artificial Analysis completed independent run)Kimi K2.5Exact identitykimi-k2-5-thinking Canonical product: kimi-k2-5 | 73% | Direct source resultindependently-verifiedVersion & systemstandard Artificial Analysis AA-LCR evaluation | Kimi K2.5 (Reasoning) current model and individual-evaluation pageObserved Checked |
Qwen3.5 397B A17B (Reasoning) (Artificial Analysis completed independent run)Qwen3.5 397B A17BExact identityqwen3-5-397b-thinking Canonical product: qwen3-5-397b | 72.7% | Direct source resultindependently-verifiedVersion & systemstandard Artificial Analysis AA-LCR evaluation | Qwen3.5 397B A17B (Reasoning) current model and individual-evaluation pageObserved Checked |
Qwen3.5 122B A10B (Reasoning) (Artificial Analysis completed independent run)Qwen3.5-122B-A10BExact identityqwen3-5-122b-a10b-aa-reasoning-default Canonical product: qwen3-5-122b-a10b | 70.3% | Direct source resultindependently-verifiedVersion & systemstandard Artificial Analysis AA-LCR evaluation | Qwen3.5 122B A10B (Reasoning) current model and individual-evaluation pageObserved Checked |
Qwen3.6 35B A3B (Reasoning) (Artificial Analysis completed independent run)Qwen3.6-35B-A3BExact identityqwen3-6-35b-a3b-aa-reasoning-default Canonical product: qwen3-6-35b-a3b | 66.7% | Direct source resultindependently-verifiedVersion & systemstandard Artificial Analysis AA-LCR evaluation | Qwen3.6 35B A3B (Reasoning) current model and individual-evaluation pageObserved Checked |
Mistral Medium 3.5 (Artificial Analysis completed independent run)Mistral Medium 3.5 128BExact identitymistral-medium-3-5-128b-aa-reasoning-default Canonical product: mistral-medium-3-5-128b | 65.3% | Direct source resultindependently-verifiedVersion & systemstandard Artificial Analysis AA-LCR evaluation | Mistral Medium 3.5 current model and individual-evaluation pageObserved Checked |
LongCat 2.0 (Artificial Analysis independent run)LongCat-2.0Exact identitylongcat-2-0-default Canonical product: longcat-2-0 | 62.7% | Direct source resultindependently-verifiedVersion & systemstandard Artificial Analysis AA-LCR evaluation | LongCat 2.0 individual evaluationsObserved Checked |
| Model | Result | Execution & attribution | Original source |
|---|---|---|---|
| Qwen3.8 Max (0902)lcr · exact AA profile b112af07-3bd5-4647-b09f-b23204361bb2 | 80.333percent | AA current published profile; effort label not exportedindependent evaluatorRetained as additional evidence. Existing Core point is unchanged pending an accepted complete own-evidence amendment; incompatible versions remain separate. | Artificial Analysis ↗Publication date not recorded · checked 2026-09-16 |
From result to context
Artificial Analysis long-context reasoning benchmark measuring extraction and synthesis over documents from roughly 10k to 100k tokens.
The summary shows one best compatible source result per canonical product. Versions, effort settings and execution systems remain attached to the underlying records.
Scores from different versions or harnesses may not be interchangeable. The published source rows preserve those distinctions and their original units. A source result is not automatically an input to a current index.
A reviewed track from this benchmark is represented in the following current indices. Each index applies its own protocol and eligibility rules.
Contamination risk: Low. Lifecycle: Active.