A task with its own rules.
A benchmark for agents performing practical tasks in reproducible terminal environments.
- Organisation
- Terminal-Bench team
- Version
- 2.1
Agents / Benchmark profile
A benchmark for agents performing practical tasks in reproducible terminal environments.
Observed results
20 ranked models · higher is better · labels show rank and score
| Model | Rank | Model ID | Provider | Score | Unit |
|---|---|---|---|---|---|
| GPT-5.6 Sol | #1 | gpt-5-6-sol | OpenAI | 91.9 | percent |
| Claude Opus 5 | #2 | claude-opus-5 | Anthropic | 89.1385767790262 | percent |
| Grok 4.6 | #3 | grok-4-6 | xAI | 88.38951310861421 | percent |
| Kimi K3 | #4 | kimi-k3 | Moonshot AI | 88.3 | percent |
| GLM-5.3 | #5 | glm-5-3 | Z.AI | 88.2 | percent |
| GPT-5.6 Terra | #6 | gpt-5-6-terra | OpenAI | 88.0149812734082 | percent |
| Claude Fable 5 | #7 | claude-fable-5 | Anthropic | 88 | percent |
| Claude Mythos 5 | #8 | claude-mythos-5 | Anthropic | 88 | percent |
| DeepSeek V4 Pro 0813 | #9 | deepseek-v4-pro-0813 | DeepSeek | 87.9 | percent |
| Qwen3.8 Max | #10 | qwen-3-8-max | Alibaba Cloud | 86.6 | percent |
| Qwen3.8-Flash-Next | #11 | qwen-3-8-flash-next | Alibaba Cloud | 86.142322097378 | percent |
| Gemini 3.7 Flash | #12 | gemini-3-7-flash | 85.8 | percent | |
| Claude Opus 4.8 | #13 | claude-opus-4-8 | Anthropic | 85 | percent |
| GPT-5.6 Luna | #14 | gpt-5-6-luna | OpenAI | 84.7 | percent |
| GPT-5.5 | #15 | gpt-5-5 | OpenAI | 84.27 | percent |
| GLM-5.3-Flash | #16 | glm-5-3-flash | Z.AI | 84.2696629213483 | percent |
| DeepSeek V4 Flash Vision Exp | #17 | deepseek-v4-flash-vision-exp | DeepSeek | 83.9 | percent |
| Grok 4.5 | #18 | grok-4-5 | xAI | 83.3 | percent |
| Claude Opus 4.7 | #19 | claude-opus-4-7 | Anthropic | 83.14606741573 | percent |
| Muse Spark 1.2 | #20 | muse-spark-1-2 | Meta | 82.9 | percent |
| DeepSeek V4 Flash 0731 | #21 | deepseek-v4-flash-0731 | DeepSeek | 82.7 | percent |
| Sakana Fugu-Ultra | #22 | sakana-fugu-ultra | Sakana AI | 82.1 | percent |
| SWE-1.7 | #23 | swe-1-7 | Cognition | 81.5 | percent |
| GLM-5.2 | #24 | glm-5-2 | Z.AI | 81 | percent |
| Claude Sonnet 5 | #25 | claude-sonnet-5 | Anthropic | 80.5243445692884 | percent |
| Sakana Fugu | #26 | sakana-fugu | Sakana AI | 80.2 | percent |
| Muse Spark 1.1 | #27 | muse-spark-1-1 | Meta | 80 | percent |
| GPT-5.4 | #28 | gpt-5-4 | OpenAI | 78.28 | percent |
| Gemini 3.6 Flash | #29 | gemini-3-6-flash | 78 | percent | |
| Ornith-1.0-397B | #30 | ornith-1-0-397b | DeepReinforce AI | 77.5 | percent |
| GPT-5.3-Codex | #31 | gpt-5-3-codex | OpenAI | 77.3 | percent |
| Gemini 3.5 Flash | #32 | gemini-3-5-flash | 76.2 | percent | |
| Qwen3.7-Max | #33 | qwen-3-7-max | Alibaba Cloud | 74.53 | percent |
| Gemini 3.1 Pro Preview | #34 | gemini-3-1-pro-preview | 73.8 | percent | |
| Qwen3.8-27B | #35 | qwen-3-8-27b | Alibaba Cloud | 73 | percent |
| DeepSeek V4 Pro | #36 | deepseek-v4-pro | DeepSeek | 72.1 | percent |
| LongCat-2.0 | #37 | longcat-2-0 | Meituan | 70.8 | percent |
| Qwen3.7-Plus | #38 | qwen-3-7-plus | Alibaba Cloud | 70.3 | percent |
| Laguna S 2.1 | #39 | laguna-s-2-1 | Poolside | 70.2 | percent |
| Composer 2.5 | #40 | composer-2-5 | Cursor | 69.3 | percent |
| MiMo-V2.5-Pro | #41 | mimo-v2-5-pro | Xiaomi | 68.4 | percent |
| Kimi K2.7 Code | #42 | kimi-k2-7-code | Moonshot AI | 67.4157 | percent |
| Kimi K2.6 | #43 | kimi-k2-6 | Moonshot AI | 66.7 | percent |
| MiniMax M3 | #44 | minimax-m3 | MiniMax | 66 | percent |
| MiMo-V2.5 | #45 | mimo-v2-5 | Xiaomi | 65.8 | percent |
| Claude Opus 4.6 | #46 | claude-opus-4-6 | Anthropic | 65.4 | percent |
| Qwen 3.6 Max (preview) | #47 | qwen3-6-max-preview | Alibaba Cloud | 65.4 | percent |
| Qwen3.6 Max | #48 | qwen3-6-max | Alibaba Cloud | 65.4 | percent |
| Ornith-1.0-35B | #49 | ornith-1-0-35b | DeepReinforce AI | 64.2 | percent |
| Inkling | #50 | inkling | Thinking Machines Lab | 63.8 | percent |
| GLM-5.1 | #51 | glm-5-1 | Z.AI | 63.5 | percent |
| DeepSeek V4 Flash | #52 | deepseek-v4-flash | DeepSeek | 61.8 | percent |
| Composer 2 | #53 | composer-2 | Cursor | 61.7 | percent |
| Qwen3.6 Plus | #54 | qwen3-6-plus | Alibaba Cloud | 61.6 | percent |
| Qwen3.6 27B | #55 | qwen3-6-27b | Alibaba Cloud | 60.6742 | percent |
| GPT-5.4 mini | #56 | gpt-5-4-mini | OpenAI | 60 | percent |
| Step 3.7 Flash | #57 | step-3-7-flash | StepFun | 59.5 | percent |
| Claude Opus 4.5 | #58 | claude-opus-4-5 | Anthropic | 59.3 | percent |
| Claude Sonnet 4.6 | #59 | claude-sonnet-4-6 | Anthropic | 59.1 | percent |
| Muse Spark | #60 | muse-spark | Meta | 59 | percent |
| MiniMax M2.7 | #61 | minimax-m2-7 | MiniMax | 57 | percent |
| Nemotron 3 Ultra | #62 | nemotron-3-ultra | NVIDIA | 56.4 | percent |
| GLM-5 | #63 | glm-5 | Z.AI | 56.2 | percent |
| Claude Sonnet 4.5 | #64 | claude-sonnet-4-5 | Anthropic | 55.8052 | percent |
| Hy3 | #65 | hy3 | Tencent | 54.4 | percent |
| Hy3 Preview | #66 | hy3-preview | Tencent | 54.4 | percent |
| Gemini 3.5 Flash-Lite | #67 | gemini-3-5-flash-lite | 54 | percent | |
| Qwen3.5 397B A17B | #68 | qwen3-5-397b | Alibaba Cloud | 52.5 | percent |
| Muse Glimmer 30B | #69 | muse-glimmer-30b | Meta | 51.7 | percent |
| Qwen3.6-35B-A3B | #70 | qwen3-6-35b-a3b | Alibaba Cloud | 51.5 | percent |
| Kimi K2.5 | #71 | kimi-k2-5 | Moonshot AI | 50.8 | percent |
| Mistral Medium 3.5 128B | #72 | mistral-medium-3-5-128b | Mistral AI | 50.561797752809 | percent |
| Mistral Medium 3.5 | #73 | mistral-medium-3-5 | Mistral AI | 50.56 | percent |
| GLM-4.6 | #74 | glm-4-6 | Z.AI | 49.4382 | percent |
| Qwen3.5-122B-A10B | #75 | qwen3-5-122b-a10b | Alibaba Cloud | 49.4 | percent |
| Qwen3.5 122B | #76 | qwen3-5-122b | Alibaba Cloud | 47.5655 | percent |
| Grok 4.20 | #77 | grok-4-20 | xAI | 47.1 | percent |
| DeepSeek V3.2 | #78 | deepseek-v3-2 | DeepSeek | 46.8165 | percent |
| GPT-5.4 nano | #79 | gpt-5-4-nano | OpenAI | 46.3 | percent |
| MAI-Thinking-1 | #80 | mai-thinking-1 | Microsoft | 46 | percent |
| Laguna M.1 | #81 | laguna-m-1 | Poolside | 45.8 | percent |
| GLM-4.7 | #82 | glm-4-7 | Z.AI | 45.3184 | percent |
| DeepSeek V3.1 Terminus | #83 | deepseek-v3-1-terminus | DeepSeek | 44.9438 | percent |
| Ornith-1.0-9B | #84 | ornith-1-0-9b | DeepReinforce AI | 43.1 | percent |
| Qwen3.5 27B | #85 | qwen3-5-27b | Alibaba Cloud | 41.6 | percent |
| Qwen3.5-35B-A3B | #86 | qwen3-5-35b-a3b | Alibaba Cloud | 40.5 | percent |
| Grok 4.3 | #87 | grok-4-3 | xAI | 39.7 | percent |
| Gemma 4 26B A4B | #88 | gemma-4-26b-a4b | 38.951310861423 | percent | |
| Gemma 4 26B | #89 | gemma-4-26b | 38.9513 | percent | |
| Nemotron 3 Super | #90 | nemotron-3-super | NVIDIA | 38.5768 | percent |
| Claude Sonnet 4 | #91 | claude-sonnet-4 | Anthropic | 36.3296 | percent |
| Laguna XS.2 | #92 | laguna-xs-2 | Poolside | 35.7 | percent |
| GPT-5 | #93 | gpt-5 | OpenAI | 35.206 | percent |
| Gemini 3.1 Flash-Lite | #94 | gemini-3-1-flash-lite | 31 | percent | |
| Nova 2 Pro | #95 | nova-2-pro | Amazon | 29.588 | percent |
| Gemini 2.5 Pro | #96 | gemini-2-5-pro | 28.4644 | percent | |
| NVIDIA Nemotron 3.5 Lightning 30B-A3B | #97 | nemotron-3-5-lightning-30b-a3b | NVIDIA | 24.58 | percent |
| Command A+ | #98 | command-a-plus | Cohere | 22.8464 | percent |
| Mistral Small 4 | #99 | mistral-small-4 | Mistral AI | 20.973782771536 | percent |
| Trinity-Large-Thinking | #100 | trinity-large-thinking | Arcee AI | 20.59925093633 | percent |
| Mistral Large 3 | #101 | mistral-large-3 | Mistral AI | 11.99 | percent |
| GPT-4.1 mini | #102 | gpt-4-1-mini | OpenAI | 10.112359550562 | percent |
| Llama 4 Maverick | #103 | llama-4-maverick | Meta | 7.865168539326 | percent |
| Nemotron 3 Nano 30B | #104 | nemotron-3-nano-30b | NVIDIA | 6.741573033708 | percent |
| Gemma 3 27B | #105 | gemma-3-27b | 4.494382022472 | percent | |
| GPT-4.1 nano | #106 | gpt-4-1-nano | OpenAI | 3.74531835206 | percent |
| Llama 4 Scout | #107 | llama-4-scout | Meta | 3.74531835206 | percent |
One best compatible score per canonical product · higher is better
| Rank | Model | Weights | Evidence | Score |
|---|---|---|---|---|
| 01 | GPT-5.6 SolOpenAI | Closed weights | Source carrier | 91.9% |
| 02 | Claude Opus 5Anthropic | Closed weights | Direct source result | 89.1% |
| 03 | Grok 4.6xAI | Closed weights | Direct source result | 88.4% |
| 04 | Kimi K3Moonshot AI | Open weights | Direct source result | 88.3% |
| 05 | GLM-5.3Z.AI | Open announced | Direct source result | 88.2% |
| 06 | GPT-5.6 TerraOpenAI | Closed weights | Direct source result | 88.0% |
| 07 | Claude Fable 5Anthropic | Closed weights | Public reference | 88% |
| 08 | Claude Mythos 5Anthropic | Closed weights | Source carrier | 88% |
| 09 | DeepSeek V4 Pro 0813DeepSeek | Open weights | Public reference | 87.9% |
| 10 | Qwen3.8 MaxAlibaba Cloud | Open weights | Direct source result | 86.6% |
Each distinct published measurement is retained. Same-snapshot canonical and configuration projections appear once.
| Published model / configuration | Score | Evidence & protocol | Source & dates |
|---|---|---|---|
Qwen3.8-Flash-Next (Artificial Analysis independent run)Qwen3.8-Flash-NextExact identityqwen-3-8-flash-next-aa-unspecified Canonical product: qwen-3-8-flash-next | 86.1% | Public referenceindependently-verifiedVersion & system2.1 Artificial Analysis Terminal-Bench v2.1 in e2b | Qwen3.8-Flash-Next individual evaluationsObserved Checked |
Claude Opus 4.7 (Adaptive Reasoning, Max Effort) (Artificial Analysis independent run)Claude Opus 4.7Exact identityclaude-opus-4-7-max Canonical product: claude-opus-4-7 | 83.1% | Direct source resultindependently-verifiedVersion & system2.1 Artificial Analysis Terminal-Bench v2.1 in e2b | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) individual evaluationsObserved Checked |
GLM-5.2 (max) (Artificial Analysis independent run)GLM-5.2Exact identityglm-5-2-max Canonical product: glm-5-2 | 77.9% | Direct source resultindependently-verifiedVersion & system2.1 Artificial Analysis Terminal-Bench v2.1 in e2b | GLM-5.2 (max) individual evaluationsObserved Checked |
Qwen3.5 397B A17B (Reasoning) (Artificial Analysis completed independent run)Qwen3.5 397B A17BExact identityqwen3-5-397b-thinking Canonical product: qwen3-5-397b | 51.3% | Direct source resultindependently-verifiedVersion & system2.1 Artificial Analysis Terminal-Bench v2.1 in e2b | Qwen3.5 397B A17B (Reasoning) current model and individual-evaluation pageObserved Checked |
Mistral Medium 3.5 (Artificial Analysis completed independent run)Mistral Medium 3.5 128BExact identitymistral-medium-3-5-128b-aa-reasoning-default Canonical product: mistral-medium-3-5-128b | 50.6% | Direct source resultindependently-verifiedVersion & system2.1 Artificial Analysis Terminal-Bench v2.1 in e2b | Mistral Medium 3.5 current model and individual-evaluation pageObserved Checked |
LongCat 2.0 (Artificial Analysis independent run)LongCat-2.0Exact identitylongcat-2-0-default Canonical product: longcat-2-0 | 50.2% | Direct source resultindependently-verifiedVersion & system2.1 Artificial Analysis Terminal-Bench v2.1 in e2b | LongCat 2.0 individual evaluationsObserved Checked |
Qwen3.5 122B A10B (Reasoning) (Artificial Analysis completed independent run)Qwen3.5-122B-A10BExact identityqwen3-5-122b-a10b-aa-reasoning-default Canonical product: qwen3-5-122b-a10b | 47.6% | Direct source resultindependently-verifiedVersion & system2.1 Artificial Analysis Terminal-Bench v2.1 in e2b | Qwen3.5 122B A10B (Reasoning) current model and individual-evaluation pageObserved Checked |
Kimi K2.5 (Reasoning) (Artificial Analysis completed independent run)Kimi K2.5Exact identitykimi-k2-5-thinking Canonical product: kimi-k2-5 | 45.7% | Direct source resultindependently-verifiedVersion & system2.1 Artificial Analysis Terminal-Bench v2.1 in e2b | Kimi K2.5 (Reasoning) current model and individual-evaluation pageObserved Checked |
Qwen3.6 35B A3B (Reasoning) (Artificial Analysis completed independent run)Qwen3.6-35B-A3BExact identityqwen3-6-35b-a3b-aa-reasoning-default Canonical product: qwen3-6-35b-a3b | 44.9% | Direct source resultindependently-verifiedVersion & system2.1 Artificial Analysis Terminal-Bench v2.1 in e2b | Qwen3.6 35B A3B (Reasoning) current model and individual-evaluation pageObserved Checked |
Gemma 4 26B A4B (Reasoning) (Artificial Analysis completed independent run)Gemma 4 26B A4BExact identitygemma-4-26b-a4b-aa-reasoning-default Canonical product: gemma-4-26b-a4b | 39.0% | Direct source resultindependently-verifiedVersion & system2.1 Artificial Analysis Terminal-Bench v2.1 in e2b | Gemma 4 26B A4B (Reasoning) current model and individual-evaluation pageObserved Checked |
From result to context
A benchmark for agents performing practical tasks in reproducible terminal environments.
The summary shows one best compatible source result per canonical product. Versions, effort settings and execution systems remain attached to the underlying records.
Scores from different versions or harnesses may not be interchangeable. The published source rows preserve those distinctions and their original units. A source result is not automatically an input to a current index.
This catalogue entry preserves available source evidence. Current indices admit only their specifically reviewed tracks and configurations.
Contamination risk: Unknown. Lifecycle: Rolling.