A task with its own rules.
Research-level physics reasoning benchmark with composite challenges designed to stress frontier scientific reasoning.
- Organisation
- CritPt authors
- Version
- Current / rolling
Reasoning / Benchmark profile
Research-level physics reasoning benchmark with composite challenges designed to stress frontier scientific reasoning.
Observed results
20 ranked models · higher is better · labels show rank and score
| Model | Rank | Model ID | Provider | Score | Unit |
|---|---|---|---|---|---|
| GPT-5.6 Sol | #1 | gpt-5-6-sol | OpenAI | 32.3 | percent |
| GPT-5.5 | #2 | gpt-5-5 | OpenAI | 30.6 | percent |
| GPT-5.4 | #3 | gpt-5-4 | OpenAI | 30 | percent |
| GPT-5.6 Terra | #4 | gpt-5-6-terra | OpenAI | 30 | percent |
| Claude Opus 5 | #5 | claude-opus-5 | Anthropic | 29.1428571428571 | percent |
| Claude Fable 5 | #6 | claude-fable-5 | Anthropic | 28.6 | percent |
| Kimi K3 | #7 | kimi-k3 | Moonshot AI | 23.4285714285714 | percent |
| Claude Opus 4.8 | #8 | claude-opus-4-8 | Anthropic | 20.9 | percent |
| GLM-5.2 | #9 | glm-5-2 | Z.AI | 20.9 | percent |
| GPT-5.6 Luna | #10 | gpt-5-6-luna | OpenAI | 20.6 | percent |
| GLM-5.3 | #11 | glm-5-3 | Z.AI | 19.1428571428571 | percent |
| DeepSeek V4 Pro 0813 | #12 | deepseek-v4-pro-0813 | DeepSeek | 18 | percent |
| Gemini 3.1 Pro Preview | #13 | gemini-3-1-pro-preview | 17.7143 | percent | |
| Muse Spark 1.2 | #14 | muse-spark-1-2 | Meta | 17.7142857142857 | percent |
| Grok 4.6 | #15 | grok-4-6 | xAI | 17.1428571428571 | percent |
| Claude Sonnet 5 | #16 | claude-sonnet-5 | Anthropic | 16.9 | percent |
| GPT-5.3-Codex | #17 | gpt-5-3-codex | OpenAI | 16.9 | percent |
| Grok 4.5 | #18 | grok-4-5 | xAI | 15.4286 | percent |
| GLM-5.3-Flash | #19 | glm-5-3-flash | Z.AI | 15.4285714285714 | percent |
| Muse Spark 1.1 | #20 | muse-spark-1-1 | Meta | 15.1429 | percent |
| Qwen3.7-Max | #21 | qwen-3-7-max | Alibaba Cloud | 13.4286 | percent |
| Gemini 3.5 Flash | #22 | gemini-3-5-flash | 13.1429 | percent | |
| DeepSeek V4 Pro | #23 | deepseek-v4-pro | DeepSeek | 12.9 | percent |
| Claude Opus 4.6 | #24 | claude-opus-4-6 | Anthropic | 12.6 | percent |
| Claude Opus 4.7 | #25 | claude-opus-4-7 | Anthropic | 12 | percent |
| GPT-5.2 | #26 | gpt-5-2 | OpenAI | 11.6 | percent |
| Muse Spark | #27 | muse-spark | Meta | 11.3306 | percent |
| Qwen3.8-Flash-Next | #28 | qwen-3-8-flash-next | Alibaba Cloud | 11.142857142857 | percent |
| DeepSeek V4 Flash Vision Exp | #29 | deepseek-v4-flash-vision-exp | DeepSeek | 10.8571428571429 | percent |
| Gemini 3.6 Flash | #30 | gemini-3-6-flash | 10.6 | percent | |
| GPT-5.4 mini | #31 | gpt-5-4-mini | OpenAI | 10 | percent |
| Kimi K2.7 Code | #32 | kimi-k2-7-code | Moonshot AI | 10 | percent |
| Gemini 3.7 Flash | #33 | gemini-3-7-flash | 9.42857142857143 | percent | |
| GPT-5.4 nano | #34 | gpt-5-4-nano | OpenAI | 9.3 | percent |
| Qwen3.7-Plus | #35 | qwen-3-7-plus | Alibaba Cloud | 9.1429 | percent |
| GPT-5.2 Codex | #36 | gpt-5-2-codex | OpenAI | 8.7 | percent |
| Gemini 3 Flash | #37 | gemini-3-flash | 8.5714 | percent | |
| Inkling-Small | #38 | inkling-small | Thinking Machines Lab | 8.3 | percent |
| Grok 4.3 | #39 | grok-4-3 | xAI | 8 | percent |
| Kimi K2.6 | #40 | kimi-k2-6 | Moonshot AI | 8 | percent |
| DeepSeek V4 Flash | #41 | deepseek-v4-flash | DeepSeek | 7.1429 | percent |
| Grok 4.20 | #42 | grok-4-20 | xAI | 6.5714 | percent |
| GPT-5 | #43 | gpt-5 | OpenAI | 5.7143 | percent |
| GPT-5.1-Codex | #44 | gpt-5-1-codex | OpenAI | 5.7 | percent |
| GPT-5.1-Codex-Max | #45 | gpt-5-1-codex-max | OpenAI | 5.7 | percent |
| Inkling | #46 | inkling | Thinking Machines Lab | 5.4 | percent |
| GPT-5 Codex | #47 | gpt-5-codex | OpenAI | 5.1429 | percent |
| GPT-5.1 | #48 | gpt-5-1 | OpenAI | 4.9 | percent |
| Hy3 | #49 | hy3 | Tencent | 4.9 | percent |
| Hy3 Preview | #50 | hy3-preview | Tencent | 4.9 | percent |
| Claude Opus 4.5 Thinking | #51 | claude-opus-4-5-thinking | Anthropic | 4.6 | percent |
| GLM-5.1 | #52 | glm-5-1 | Z.AI | 4.6 | percent |
| Claude Opus 4.5 | #53 | claude-opus-4-5 | Anthropic | 4.5714 | percent |
| MiMo-V2.5-Pro | #54 | mimo-v2-5-pro | Xiaomi | 4 | percent |
| MiMo-V2.5 | #55 | mimo-v2-5 | Xiaomi | 3.7143 | percent |
| MiniMax M3 | #56 | minimax-m3 | MiniMax | 3.7143 | percent |
| Qwen3.6 Max | #57 | qwen3-6-max | Alibaba Cloud | 3.7061 | percent |
| Qwen 3.6 Max (preview) | #58 | qwen3-6-max-preview | Alibaba Cloud | 3.7 | percent |
| Claude Sonnet 4.6 | #59 | claude-sonnet-4-6 | Anthropic | 3.1429 | percent |
| Kimi K2.5 | #60 | kimi-k2-5 | Moonshot AI | 3.1429 | percent |
| Nemotron 3 Super | #61 | nemotron-3-super | NVIDIA | 3.1429 | percent |
| Nemotron 3 Ultra | #62 | nemotron-3-ultra | NVIDIA | 3.1429 | percent |
| Grok 4 Fast (Reasoning) | #63 | grok-4-fast-reasoning | xAI | 2.9 | percent |
| Grok 4.1 Fast (Reasoning) | #64 | grok-4-1-fast-reasoning | xAI | 2.9 | percent |
| Qwen3.6 Plus | #65 | qwen3-6-plus | Alibaba Cloud | 2.9 | percent |
| DeepSeek V3.2 | #66 | deepseek-v3-2 | DeepSeek | 2.8571 | percent |
| Grok 4 Fast | #67 | grok-4-fast | xAI | 2.8571 | percent |
| Gemini 2.5 Pro | #68 | gemini-2-5-pro | 2.6 | percent | |
| LongCat-2.0 | #69 | longcat-2-0 | Meituan | 2.571428571429 | percent |
| Kimi K2 Thinking | #70 | kimi-k2-thinking | Moonshot AI | 2.5714 | percent |
| Step 3.7 Flash | #71 | step-3-7-flash | StepFun | 2.3 | percent |
| DeepSeek V3.1 | #72 | deepseek-v3-1 | DeepSeek | 2 | percent |
| GLM-5 | #73 | glm-5 | Z.AI | 2 | percent |
| Grok 4 | #74 | grok-4 | xAI | 2 | percent |
| DeepSeek V3.1 Terminus | #75 | deepseek-v3-1-terminus | DeepSeek | 1.7143 | percent |
| Qwen3 Max | #76 | qwen3-max | Alibaba Cloud | 1.7143 | percent |
| GLM-4.7 | #77 | glm-4-7 | Z.AI | 1.7102 | percent |
| Qwen3.5 397B A17B | #78 | qwen3-5-397b | Alibaba Cloud | 1.70612244898 | percent |
| Gemma 4 31B | #79 | gemma-4-31b | 1.4286 | percent | |
| GPT-5 mini | #80 | gpt-5-mini | OpenAI | 1.4286 | percent |
| DeepSeek-R1 | #81 | deepseek-r1 | DeepSeek | 1.4 | percent |
| Gemini 2.5 Flash | #82 | gemini-2-5-flash | 1.4 | percent | |
| GPT-OSS 20B | #83 | gpt-oss-20b | OpenAI | 1.4 | percent |
| Claude Sonnet 4.5 | #84 | claude-sonnet-4-5 | Anthropic | 1.1429 | percent |
| Gemini 3.1 Flash-Lite | #85 | gemini-3-1-flash-lite | 1.1429 | percent | |
| GLM-4.6 | #86 | glm-4-6 | Z.AI | 1.1429 | percent |
| MiMo-V2-Omni | #87 | mimo-v2-omni | Xiaomi | 1.1429 | percent |
| MiniMax M2.5 | #88 | minimax-m2-5 | MiniMax | 1.1429 | percent |
| o3 | #89 | o3 | OpenAI | 1.1429 | percent |
| Qwen3.6 27B | #90 | qwen3-6-27b | Alibaba Cloud | 1.1429 | percent |
| Claude 4 Sonnet | #91 | claude-4-sonnet | Anthropic | 1.1 | percent |
| GPT-OSS 120B | #92 | gpt-oss-120b | OpenAI | 1.1 | percent |
| K-Exaone | #93 | k-exaone | LG AI Research | 1.1 | percent |
| Nemotron 3 Nano 30B | #94 | nemotron-3-nano-30b | NVIDIA | 0.9 | percent |
| Qwen3.5 27B | #95 | qwen3-5-27b | Alibaba Cloud | 0.9 | percent |
| Qwen3.5-35B-A3B | #96 | qwen3-5-35b-a3b | Alibaba Cloud | 0.9 | percent |
| Trinity-Large-Preview | #97 | trinity-large-preview | Arcee AI | 0.9 | percent |
| Trinity-Large-Thinking | #98 | trinity-large-thinking | Arcee AI | 0.9 | percent |
| Claude Sonnet 3.7 | #99 | claude-sonnet-3-7 | Anthropic | 0.8571 | percent |
| MiniMax M2 | #100 | minimax-m2 | MiniMax | 0.8571 | percent |
| Qwen3.5 35B | #101 | qwen3-5-35b | Alibaba Cloud | 0.8571 | percent |
| Gemma 4 E4B | #102 | gemma-4-e4b | 0.6 | percent | |
| GLM-5V-Turbo | #103 | glm-5v-turbo | Z.AI | 0.6 | percent |
| MiniMax M2.7 | #104 | minimax-m2-7 | MiniMax | 0.6 | percent |
| Qwen3.5-122B-A10B | #105 | qwen3-5-122b-a10b | Alibaba Cloud | 0.6 | percent |
| Grok 3 mini | #106 | grok-3-mini | xAI | 0.5714 | percent |
| o4-mini | #107 | o4-mini | OpenAI | 0.5714 | percent |
| Qwen3.5 122B | #108 | qwen3-5-122b | Alibaba Cloud | 0.5714 | percent |
| Qwen3.5 Omni Plus | #109 | qwen3-5-omni-plus | Alibaba Cloud | 0.5633 | percent |
| Command A+ | #110 | command-a-plus | Cohere | 0.3 | percent |
| GLM-5-Turbo | #111 | glm-5-turbo | Z.AI | 0.3 | percent |
| MiMo-V2-Pro | #112 | mimo-v2-pro | Xiaomi | 0.3 | percent |
| Mistral Small 4 | #113 | mistral-small-4 | Mistral AI | 0.3 | percent |
| o1 | #114 | o1 | OpenAI | 0.3 | percent |
| Qwen3.6-35B-A3B | #115 | qwen3-6-35b-a3b | Alibaba Cloud | 0.3 | percent |
| Sarvam 30B | #116 | sarvam-30b | Sarvam | 0.3 | percent |
| Claude Sonnet 4 | #117 | claude-sonnet-4 | Anthropic | 0.2857 | percent |
| Ling 2.6 1T | #118 | ling-2-6-1t | InclusionAI | 0.2857 | percent |
| MiniMax M2.1 | #119 | minimax-m2-1 | MiniMax | 0.2857 | percent |
| Claude 3 Haiku | #120 | claude-3-haiku | Anthropic | 0 | percent |
| Claude 4.1 Opus Thinking | #121 | claude-4-1-opus-thinking | Anthropic | 0 | percent |
| Claude Haiku 4.5 | #122 | claude-haiku-4-5 | Anthropic | 0 | percent |
| Claude Opus 4.1 | #123 | claude-opus-4-1 | Anthropic | 0 | percent |
| DeepSeek V3 | #124 | deepseek-v3 | DeepSeek | 0 | percent |
| Exaone 4.0 1.2B | #125 | exaone-4-0-1-2b | LG AI Research | 0 | percent |
| Exaone 4.0 32B | #126 | exaone-4-0-32b | LG AI Research | 0 | percent |
| Gemini 3.5 Flash-Lite | #127 | gemini-3-5-flash-lite | 0 | percent | |
| Gemma 3 27B | #128 | gemma-3-27b | 0 | percent | |
| Gemma 4 12B Unified | #129 | gemma-4-12b | 0 | percent | |
| Gemma 4 26B | #130 | gemma-4-26b | 0 | percent | |
| Gemma 4 26B A4B | #131 | gemma-4-26b-a4b | 0 | percent | |
| Gemma 4 E2B | #132 | gemma-4-e2b | 0 | percent | |
| GLM-4.5-Air | #133 | glm-4-5-air | Z.AI | 0 | percent |
| GPT-4.1 | #134 | gpt-4-1 | OpenAI | 0 | percent |
| GPT-4.1 mini | #135 | gpt-4-1-mini | OpenAI | 0 | percent |
| GPT-4.1 nano | #136 | gpt-4-1-nano | OpenAI | 0 | percent |
| GPT-4o | #137 | gpt-4o | OpenAI | 0 | percent |
| Granite-4.0-1B | #138 | granite-4-0-1b | IBM | 0 | percent |
| Granite-4.0-350M | #139 | granite-4-0-350m | IBM | 0 | percent |
| Granite-4.0-H-1B | #140 | granite-4-0-h-1b | IBM | 0 | percent |
| Granite-4.0-H-350M | #141 | granite-4-0-h-350m | IBM | 0 | percent |
| Grok 4.1 Fast | #142 | grok-4-1-fast | xAI | 0 | percent |
| Grok Code Fast 1 | #143 | grok-code-fast-1 | xAI | 0 | percent |
| Kimi K2 | #144 | kimi-k2 | Moonshot AI | 0 | percent |
| Kimi K2 0905 | #145 | kimi-k2-0905 | Moonshot AI | 0 | percent |
| LFM2.5-8B-A1B | #146 | lfm2-5-8b-a1b | LiquidAI | 0 | percent |
| LFM2.5-VL-1.6B-Extract | #147 | lfm2-5-vl-1-6b-extract | LiquidAI | 0 | percent |
| Ling 2.6 Flash | #148 | ling-2-6-flash | InclusionAI | 0 | percent |
| Llama 3.1 405B | #149 | llama-3-1-405b | Meta | 0 | percent |
| Llama 4 Maverick | #150 | llama-4-maverick | Meta | 0 | percent |
| Llama 4 Scout | #151 | llama-4-scout | Meta | 0 | percent |
| Mistral Large 2 | #152 | mistral-large-2 | Mistral AI | 0 | percent |
| Mistral Large 3 | #153 | mistral-large-3 | Mistral AI | 0 | percent |
| Mistral Medium 3 | #154 | mistral-medium-3 | Mistral AI | 0 | percent |
| Mistral Medium 3.5 | #155 | mistral-medium-3-5 | Mistral AI | 0 | percent |
| Mistral Medium 3.5 128B | #156 | mistral-medium-3-5-128b | Mistral AI | 0 | percent |
| Nemotron 3 Nano Omni 30B A3B | #157 | nemotron-3-nano-omni-30b-a3b | NVIDIA | 0 | percent |
| Nemotron Ultra 253B | #158 | nemotron-ultra-253b | NVIDIA | 0 | percent |
| Nova 2 Pro | #159 | nova-2-pro | Amazon | 0 | percent |
| Nova Pro | #160 | nova-pro | Amazon | 0 | percent |
| Phi-4 | #161 | phi-4 | Microsoft | 0 | percent |
| Sarvam 105B | #162 | sarvam-105b | Sarvam | 0 | percent |
| Solar Pro 2 | #163 | solar-pro-2 | Upstage | 0 | percent |
One best compatible score per canonical product · higher is better
| Rank | Model | Weights | Evidence | Score |
|---|---|---|---|---|
| 01 | GPT-5.6 SolOpenAI | Closed weights | Source carrier | 32.3% |
| 02 | GPT-5.5OpenAI | Closed weights | Source carrier | 30.6% |
| 03 | GPT-5.4OpenAI | Closed weights | Public reference | 30% |
| 04 | GPT-5.6 TerraOpenAI | Closed weights | Direct source result | 30% |
| 05 | Claude Opus 5Anthropic | Closed weights | Direct source result | 29.1% |
| 06 | Claude Fable 5Anthropic | Closed weights | Source carrier | 28.6% |
| 07 | Kimi K3Moonshot AI | Open weights | Direct source result | 23.4% |
| 08 | Claude Opus 4.8Anthropic | Closed weights | Source carrier | 20.9% |
| 09 | GLM-5.2Z.AI | Open weights | Source carrier | 20.9% |
| 10 | GPT-5.6 LunaOpenAI | Closed weights | Source carrier | 20.6% |
Each distinct published measurement is retained. Same-snapshot canonical and configuration projections appear once.
| Published model / configuration | Score | Evidence & protocol | Source & dates |
|---|---|---|---|
GPT-5.4 Pro (xhigh) (Artificial Analysis completed independent run)GPT-5.4Exact identitygpt-5-4-pro-xhigh Canonical product: gpt-5-4 | 30% | Public referenceindependently-verifiedVersion & systemstandard Artificial Analysis CritPt evaluation | GPT-5.4 Pro (xhigh) current model and individual-evaluation pageObserved Checked |
GLM-5.2 (max) (Artificial Analysis independent run)GLM-5.2Exact identityglm-5-2-max Canonical product: glm-5-2 | 20.9% | Direct source resultindependently-verifiedVersion & systemstandard Artificial Analysis CritPt evaluation | GLM-5.2 (max) individual evaluationsObserved Checked |
Claude Opus 4.6 (Adaptive Reasoning, Max Effort) (Artificial Analysis independent run)Claude Opus 4.6Exact identityclaude-opus-4-6-max Canonical product: claude-opus-4-6 | 12.6% | Public referenceindependently-verifiedVersion & systemstandard Artificial Analysis CritPt evaluation | Claude Opus 4.6 (Adaptive Reasoning, Max Effort) individual evaluationsObserved Checked |
Claude Opus 4.7 (Adaptive Reasoning, Max Effort) (Artificial Analysis independent run)Claude Opus 4.7Exact identityclaude-opus-4-7-max Canonical product: claude-opus-4-7 | 12% | Direct source resultindependently-verifiedVersion & systemstandard Artificial Analysis CritPt evaluation | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) individual evaluationsObserved Checked |
Qwen3.8-Flash-Next (Artificial Analysis independent run)Qwen3.8-Flash-NextExact identityqwen-3-8-flash-next-aa-unspecified Canonical product: qwen-3-8-flash-next | 11.1% | Public referenceindependently-verifiedVersion & systemstandard Artificial Analysis CritPt evaluation | Qwen3.8-Flash-Next individual evaluationsObserved Checked |
Kimi K2.5 (Reasoning) (Artificial Analysis completed independent run)Kimi K2.5Exact identitykimi-k2-5-thinking Canonical product: kimi-k2-5 | 3.1% | Direct source resultindependently-verifiedVersion & systemstandard Artificial Analysis CritPt evaluation | Kimi K2.5 (Reasoning) current model and individual-evaluation pageObserved Checked |
LongCat 2.0 (Artificial Analysis independent run)LongCat-2.0Exact identitylongcat-2-0-default Canonical product: longcat-2-0 | 2.6% | Direct source resultindependently-verifiedVersion & systemstandard Artificial Analysis CritPt evaluation | LongCat 2.0 individual evaluationsObserved Checked |
DeepSeek V3.1 (Reasoning) (Artificial Analysis independent run)DeepSeek V3.1Exact identitydeepseek-v3-1-reasoning-default Canonical product: deepseek-v3-1 | 2% | Public referenceindependently-verifiedVersion & systemstandard Artificial Analysis CritPt evaluation | DeepSeek V3.1 (Reasoning) individual evaluationsObserved Checked |
Qwen3.5 397B A17B (Reasoning) (Artificial Analysis completed independent run)Qwen3.5 397B A17BExact identityqwen3-5-397b-thinking Canonical product: qwen3-5-397b | 1.7% | Direct source resultindependently-verifiedVersion & systemstandard Artificial Analysis CritPt evaluation | Qwen3.5 397B A17B (Reasoning) current model and individual-evaluation pageObserved Checked |
NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) (Artificial Analysis completed independent run)Nemotron 3 Nano 30BExact identitynemotron-3-nano-30b-aa-reasoning-default Canonical product: nemotron-3-nano-30b | 0.9% | Direct source resultindependently-verifiedVersion & systemstandard Artificial Analysis CritPt evaluation | NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) current model and individual-evaluation pageObserved Checked |
| Model | Result | Execution & attribution | Original source |
|---|---|---|---|
| Qwen3.8 Max (0902)critpt · exact AA profile b112af07-3bd5-4647-b09f-b23204361bb2 | 17.714percent | AA current published profile; effort label not exportedindependent evaluatorRetained as additional evidence. Existing Core point is unchanged pending an accepted complete own-evidence amendment; incompatible versions remain separate. | Artificial Analysis ↗Publication date not recorded · checked 2026-09-16 |
From result to context
Research-level physics reasoning benchmark with composite challenges designed to stress frontier scientific reasoning.
The summary shows one best compatible source result per canonical product. Versions, effort settings and execution systems remain attached to the underlying records.
Scores from different versions or harnesses may not be interchangeable. The published source rows preserve those distinctions and their original units. A source result is not automatically an input to a current index.
This catalogue entry preserves available source evidence. Current indices admit only their specifically reviewed tracks and configurations.
Contamination risk: Low. Lifecycle: Active.