A task with its own rules.
A game-environment benchmark that evaluates AI models in novel games covering strategic planning, resource management, spatial reasoning, cooperation, and theory of mind.
- Organisation
- Gert Labs
- Version
- 2026
Agents / Benchmark profile
A game-environment benchmark that evaluates AI models in novel games covering strategic planning, resource management, spatial reasoning, cooperation, and theory of mind.
Observed results
20 ranked models · higher is better · labels show rank and score
| Model | Rank | Model ID | Provider | Score | Unit |
|---|---|---|---|---|---|
| Claude Opus 4.8 | #1 | claude-opus-4-8 | Anthropic | 72.97 | percent |
| GPT-5.5 | #2 | gpt-5-5 | OpenAI | 72.93 | percent |
| Claude Opus 4.7 | #3 | claude-opus-4-7 | Anthropic | 65.59 | percent |
| GPT-5.4 | #4 | gpt-5-4 | OpenAI | 64.89 | percent |
| Qwen3.7-Max | #5 | qwen-3-7-max | Alibaba Cloud | 64.27 | percent |
| Claude Opus 4.5 | #6 | claude-opus-4-5 | Anthropic | 64.23 | percent |
| Claude Sonnet 4.6 | #7 | claude-sonnet-4-6 | Anthropic | 62.92 | percent |
| MiMo-V2.5-Pro | #8 | mimo-v2-5-pro | Xiaomi | 62.7 | percent |
| Claude Opus 4.6 | #9 | claude-opus-4-6 | Anthropic | 61.85 | percent |
| Gemini 3.5 Flash | #10 | gemini-3-5-flash | 61.85 | percent | |
| GLM-5.1 | #11 | glm-5-1 | Z.AI | 60.11 | percent |
| GPT-5.3-Codex | #12 | gpt-5-3-codex | OpenAI | 57.47 | percent |
| Kimi K2.6 | #13 | kimi-k2-6 | Moonshot AI | 56.82 | percent |
| Gemini 3 Flash | #14 | gemini-3-flash | 56.63 | percent | |
| Qwen3.6 27B | #15 | qwen3-6-27b | Alibaba Cloud | 54.84 | percent |
| DeepSeek V4 Flash | #16 | deepseek-v4-flash | DeepSeek | 54.35 | percent |
| GPT-5.2 Codex | #17 | gpt-5-2-codex | OpenAI | 51.79 | percent |
| Step 3.7 Flash | #18 | step-3-7-flash | StepFun | 51.57 | percent |
| GLM-5 | #19 | glm-5 | Z.AI | 50.99 | percent |
| Qwen3.6 Plus | #20 | qwen3-6-plus | Alibaba Cloud | 50.6 | percent |
| DeepSeek V4 Pro | #21 | deepseek-v4-pro | DeepSeek | 50.28 | percent |
| GPT-5.1-Codex | #22 | gpt-5-1-codex | OpenAI | 49.68 | percent |
| Grok Build 0.1 | #23 | grok-build-0-1 | xAI | 49.15 | percent |
| Claude Sonnet 4.5 | #24 | claude-sonnet-4-5 | Anthropic | 48.51 | percent |
| Grok 4.1 Fast | #25 | grok-4-1-fast | xAI | 47.32 | percent |
| MiMo-V2.5 | #26 | mimo-v2-5 | Xiaomi | 46.89 | percent |
| Qwen3.5 397B A17B | #27 | qwen3-5-397b | Alibaba Cloud | 46.76 | percent |
| GPT-5.2 | #28 | gpt-5-2 | OpenAI | 46.54 | percent |
| Kimi K2.5 | #29 | kimi-k2-5 | Moonshot AI | 45.88 | percent |
| Grok 4.3 | #30 | grok-4-3 | xAI | 43.86 | percent |
| Qwen3 Max | #31 | qwen3-max | Alibaba Cloud | 43.74 | percent |
| Qwen3.6-35B-A3B | #32 | qwen3-6-35b-a3b | Alibaba Cloud | 42.65 | percent |
| Grok 4 | #33 | grok-4 | xAI | 42.34 | percent |
| Gemini 2.5 Pro | #34 | gemini-2-5-pro | 42.01 | percent | |
| GPT-5.1 | #35 | gpt-5-1 | OpenAI | 41.24 | percent |
| MiniMax M2.7 | #36 | minimax-m2-7 | MiniMax | 40.4 | percent |
| GLM-4.7 | #37 | glm-4-7 | Z.AI | 39.95 | percent |
| Claude 4 Sonnet | #38 | claude-4-sonnet | Anthropic | 39.66 | percent |
| Qwen3.5 27B | #39 | qwen3-5-27b | Alibaba Cloud | 39.41 | percent |
| Mistral Medium 3.5 128B | #40 | mistral-medium-3-5-128b | Mistral AI | 39.1 | percent |
| Gemini 3.1 Flash-Lite | #41 | gemini-3-1-flash-lite | 38.46 | percent | |
| Grok 4.20 | #42 | grok-4-20 | xAI | 38.36 | percent |
| Hy3 Preview | #43 | hy3-preview | Tencent | 36.91 | percent |
| MiMo-V2-Pro | #44 | mimo-v2-pro | Xiaomi | 36.68 | percent |
| Gemma 4 31B | #45 | gemma-4-31b | 35.26 | percent | |
| Trinity-Large-Thinking | #46 | trinity-large-thinking | Arcee AI | 32.55 | percent |
| GLM-5V-Turbo | #47 | glm-5v-turbo | Z.AI | 30.76 | percent |
| GPT-OSS 120B | #48 | gpt-oss-120b | OpenAI | 29.61 | percent |
| DeepSeek V3.2 | #49 | deepseek-v3-2 | DeepSeek | 29.57 | percent |
| Qwen3.5-35B-A3B | #50 | qwen3-5-35b-a3b | Alibaba Cloud | 28.96 | percent |
| GPT-4.1 | #51 | gpt-4-1 | OpenAI | 25.65 | percent |
One best compatible score per canonical product · higher is better
| Rank | Model | Weights | Evidence | Score |
|---|---|---|---|---|
| 01 | Claude Opus 4.8Anthropic | Closed weights | Source carrier | 73.0% |
| 02 | GPT-5.5OpenAI | Closed weights | Source carrier | 72.9% |
| 03 | Claude Opus 4.7Anthropic | Closed weights | Source carrier | 65.6% |
| 04 | GPT-5.4OpenAI | Closed weights | Source carrier | 64.9% |
| 05 | Qwen3.7-MaxAlibaba Cloud | Closed weights | Source carrier | 64.3% |
| 06 | Claude Opus 4.5Anthropic | Closed weights | Source carrier | 64.2% |
| 07 | Claude Sonnet 4.6Anthropic | Closed weights | Source carrier | 62.9% |
| 08 | MiMo-V2.5-ProXiaomi | Open weights | Source carrier | 62.7% |
| 09 | Claude Opus 4.6Anthropic | Closed weights | Source carrier | 61.9% |
| 10 | Gemini 3.5 FlashGoogle | Closed weights | Source carrier | 61.9% |
Each distinct published measurement is retained. Same-snapshot canonical and configuration projections appear once.
| Published model / configuration | Score | Evidence & protocol | Source & dates |
|---|---|---|---|
Exact BenchLM registry variant Claude Opus 4.8; bulk export does not retain a complete upstream harness configuration.Claude Opus 4.8Exact identitySource label without a registered configuration ID Canonical product: claude-opus-4-8 | 73.0% | Source carriersource-checkedVersion & system2026 Source-native system | BenchLM public datasets — 2026-08-01Observed Checked |
Exact BenchLM registry variant GPT-5.5; bulk export does not retain a complete upstream harness configuration.GPT-5.5Exact identitySource label without a registered configuration ID Canonical product: gpt-5-5 | 72.9% | Source carriersource-checkedVersion & system2026 Source-native system | BenchLM public datasets — 2026-08-01Observed Checked |
Exact BenchLM registry variant Claude Opus 4.7; bulk export does not retain a complete upstream harness configuration.Claude Opus 4.7Exact identitySource label without a registered configuration ID Canonical product: claude-opus-4-7 | 65.6% | Source carriersource-checkedVersion & system2026 Source-native system | BenchLM public datasets — 2026-08-01Observed Checked |
Exact BenchLM registry variant GPT-5.4; bulk export does not retain a complete upstream harness configuration.GPT-5.4Exact identitySource label without a registered configuration ID Canonical product: gpt-5-4 | 64.9% | Source carriersource-checkedVersion & system2026 Source-native system | BenchLM public datasets — 2026-08-01Observed Checked |
Exact BenchLM registry variant Qwen3.7 Max; bulk export does not retain a complete upstream harness configuration.Qwen3.7-MaxExact identitySource label without a registered configuration ID Canonical product: qwen-3-7-max | 64.3% | Source carriersource-checkedVersion & system2026 Source-native system | BenchLM public datasets — 2026-08-01Observed Checked |
Exact BenchLM registry variant Claude Opus 4.5; bulk export does not retain a complete upstream harness configuration.Claude Opus 4.5Exact identitySource label without a registered configuration ID Canonical product: claude-opus-4-5 | 64.2% | Source carriersource-checkedVersion & system2026 Source-native system | BenchLM public datasets — 2026-08-01Observed Checked |
Exact BenchLM registry variant Claude Sonnet 4.6; bulk export does not retain a complete upstream harness configuration.Claude Sonnet 4.6Exact identitySource label without a registered configuration ID Canonical product: claude-sonnet-4-6 | 62.9% | Source carriersource-checkedVersion & system2026 Source-native system | BenchLM public datasets — 2026-08-01Observed Checked |
Exact BenchLM registry variant MiMo-V2.5-Pro; bulk export does not retain a complete upstream harness configuration.MiMo-V2.5-ProExact identitySource label without a registered configuration ID Canonical product: mimo-v2-5-pro | 62.7% | Source carriersource-checkedVersion & system2026 Source-native system | BenchLM public datasets — 2026-08-01Observed Checked |
Exact BenchLM registry variant Claude Opus 4.6; bulk export does not retain a complete upstream harness configuration.Claude Opus 4.6Exact identitySource label without a registered configuration ID Canonical product: claude-opus-4-6 | 61.9% | Source carriersource-checkedVersion & system2026 Source-native system | BenchLM public datasets — 2026-08-01Observed Checked |
Exact BenchLM registry variant Gemini 3.5 Flash; bulk export does not retain a complete upstream harness configuration.Gemini 3.5 FlashExact identitySource label without a registered configuration ID Canonical product: gemini-3-5-flash | 61.9% | Source carriersource-checkedVersion & system2026 Source-native system | BenchLM public datasets — 2026-08-01Observed Checked |
From result to context
A game-environment benchmark that evaluates AI models in novel games covering strategic planning, resource management, spatial reasoning, cooperation, and theory of mind.
The summary shows one best compatible source result per canonical product. Versions, effort settings and execution systems remain attached to the underlying records.
Scores from different versions or harnesses may not be interchangeable. The published source rows preserve those distinctions and their original units. A source result is not automatically an input to a current index.
This catalogue entry preserves available source evidence. Current indices admit only their specifically reviewed tracks and configurations.
Contamination risk: Unknown. Lifecycle: Active.