A task with its own rules.
Evaluates computer-use agents in verified desktop interaction tasks.
- Organisation
- OSWorld
- Version
- Verified
Agents / Benchmark profile
Evaluates computer-use agents in verified desktop interaction tasks.
Observed results
20 ranked models · higher is better · labels show rank and score
| Model | Rank | Model ID | Provider | Score | Unit |
|---|---|---|---|---|---|
| Qwen3.8 Max | #1 | qwen-3-8-max | Alibaba Cloud | 86.1 | percent |
| Claude Fable 5 | #2 | claude-fable-5 | Anthropic | 85 | percent |
| Claude Mythos 5 | #3 | claude-mythos-5 | Anthropic | 85 | percent |
| Qwen3.8-27B | #4 | qwen-3-8-27b | Alibaba Cloud | 84.3 | percent |
| Claude Opus 4.8 | #5 | claude-opus-4-8 | Anthropic | 83.4 | percent |
| Gemini 3.6 Flash | #6 | gemini-3-6-flash | 83 | percent | |
| Holo3-35B-A3B | #7 | holo3-35b-a3b | H Company | 82.56 | percent |
| Claude Sonnet 5 | #8 | claude-sonnet-5 | Anthropic | 81.2 | percent |
| Muse Spark 1.1 | #9 | muse-spark-1-1 | Meta | 80.8 | percent |
| Holo3-122B-A10B | #10 | holo3-122b-a10b | H Company | 78.85 | percent |
| GPT-5.5 | #11 | gpt-5-5 | OpenAI | 78.7 | percent |
| Gemini 3.5 Flash | #12 | gemini-3-5-flash | 78.4 | percent | |
| Claude Opus 4.7 | #13 | claude-opus-4-7 | Anthropic | 78 | percent |
| Gemini 3.1 Pro Preview | #14 | gemini-3-1-pro-preview | 76.2 | percent | |
| GPT-5.4 | #15 | gpt-5-4 | OpenAI | 75 | percent |
| Gemini 3.5 Flash-Lite | #16 | gemini-3-5-flash-lite | 74 | percent | |
| Qwen3.7-Plus | #17 | qwen-3-7-plus | Alibaba Cloud | 73.3 | percent |
| Kimi K2.6 | #18 | kimi-k2-6 | Moonshot AI | 73.1 | percent |
| Claude Opus 4.6 | #19 | claude-opus-4-6 | Anthropic | 72.7 | percent |
| GPT-5.6 Luna | #20 | gpt-5-6-luna | OpenAI | 72.6 | percent |
| Claude Sonnet 4.6 | #21 | claude-sonnet-4-6 | Anthropic | 72.1 | percent |
| GPT-5.4 mini | #22 | gpt-5-4-mini | OpenAI | 72.1 | percent |
| MiniMax M3 | #23 | minimax-m3 | MiniMax | 70.06 | percent |
| Claude Opus 4.5 | #24 | claude-opus-4-5 | Anthropic | 66.3 | percent |
| Muse Glimmer 30B | #25 | muse-glimmer-30b | Meta | 65.9 | percent |
| Gemini 3 Flash | #26 | gemini-3-flash | 65.1 | percent | |
| GPT-5.3-Codex | #27 | gpt-5-3-codex | OpenAI | 64.7 | percent |
| Claude Sonnet 4.5 | #28 | claude-sonnet-4-5 | Anthropic | 61.4 | percent |
| Qwen3.5-122B-A10B | #29 | qwen3-5-122b-a10b | Alibaba Cloud | 58 | percent |
| Qwen3.5 27B | #30 | qwen3-5-27b | Alibaba Cloud | 56.2 | percent |
| Qwen3.5-35B-A3B | #31 | qwen3-5-35b-a3b | Alibaba Cloud | 54.5 | percent |
| GPT-5.2 | #32 | gpt-5-2 | OpenAI | 47.3 | percent |
| GPT-5.4 nano | #33 | gpt-5-4-nano | OpenAI | 39 | percent |
One best compatible score per canonical product · higher is better
| Rank | Model | Weights | Evidence | Score |
|---|---|---|---|---|
| 01 | Qwen3.8 MaxAlibaba Cloud | Open weights | Direct source result | 86.1% |
| 02 | Claude Fable 5Anthropic | Closed weights | Source carrier | 85% |
| 03 | Claude Mythos 5Anthropic | Closed weights | Source carrier | 85% |
| 04 | Qwen3.8-27BAlibaba Cloud | Open weights | Direct source result | 84.3% |
| 05 | Claude Opus 4.8Anthropic | Closed weights | Source carrier | 83.4% |
| 06 | Gemini 3.6 FlashGoogle | Closed weights | Direct source result | 83% |
| 07 | Holo3-35B-A3BH Company | Open weights | Source carrier | 82.6% |
| 08 | Claude Sonnet 5Anthropic | Closed weights | Source carrier | 81.2% |
| 09 | Muse Spark 1.1Meta | Closed weights | Direct source result | 80.8% |
| 10 | Holo3-122B-A10BH Company | Closed weights | Source carrier | 78.8% |
Each distinct published measurement is retained. Same-snapshot canonical and configuration projections appear once.
| Published model / configuration | Score | Evidence & protocol | Source & dates |
|---|---|---|---|
Qwen3.8-27B (xhigh)Qwen3.8-27BExact identityqwen-3-8-27b-xhigh Canonical product: qwen-3-8-27b | 84.3% | Direct source resultprovider-reportedVersion & systemVerified Qwen3.8-27B official VL table | Qwen3.8-27B official model cardObserved Checked |
Qwen3.7-Plus as published by QwenQwen3.7-PlusExact identityqwen-3-7-plus-unspecified Canonical product: qwen-3-7-plus | 73.3% | Relative comparisonprovider-reportedVersion & systemVerified Qwen3.8-27B official VL table | Qwen3.8-27B official model cardObserved Checked |
Claude Opus 4.6 Max as published by QwenClaude Opus 4.6Exact identityclaude-opus-4-6-max Canonical product: claude-opus-4-6 | 72.7% | Relative comparisonprovider-reportedVersion & systemVerified Qwen3.8-27B official VL table | Qwen3.8-27B official model cardObserved Checked |
Qwen3.6-27B as published by QwenQwen3.6 27BExact identityqwen3-6-27b-default Canonical product: qwen3-6-27b | 63.9% | Relative comparisonprovider-reportedVersion & systemVerified Qwen3.8-27B official VL table | Qwen3.8-27B official model cardObserved Checked |
Muse Glimmer-30B; high reasoning; temperature=1.0; top_p=0.95; top_k=64Muse Glimmer 30BExact identitymuse-glimmer-30b-high Canonical product: muse-glimmer-30b | 65.9% | Public referenceprovider-reportedVersion & systemVerified / 361 tasks OSWorld-Verified GUI evaluation, four attempts per task | Muse Glimmer Evaluation MethodologyObserved Checked |
Qwen3.8 Max (xhigh, default reasoning effort)Qwen3.8 MaxExact identityqwen-3-8-max-xhigh Canonical product: qwen-3-8-max | 86.1% | Public referenceprovider-reportedVersion & systemVerified OSWorld-Verified harness | Qwen3.8 Max official releaseObserved Checked |
Exact BenchLM registry variant Claude Fable 5; bulk export does not retain a complete upstream harness configuration.Claude Fable 5Exact identitySource label without a registered configuration ID Canonical product: claude-fable-5 | 85% | Source carriersource-checkedVersion & system2025 Source-native system | BenchLM public datasets — 2026-08-01Observed Checked |
Exact BenchLM registry variant Claude Mythos 5; bulk export does not retain a complete upstream harness configuration.Claude Mythos 5Exact identitySource label without a registered configuration ID Canonical product: claude-mythos-5 | 85% | Source carriersource-checkedVersion & system2025 Source-native system | BenchLM public datasets — 2026-08-01Observed Checked |
Exact BenchLM registry variant Claude Opus 4.8; bulk export does not retain a complete upstream harness configuration.Claude Opus 4.8Exact identitySource label without a registered configuration ID Canonical product: claude-opus-4-8 | 83.4% | Source carriersource-checkedVersion & system2025 Source-native system | BenchLM public datasets — 2026-08-01Observed Checked |
Exact BenchLM registry variant Gemini 3.6 Flash; bulk export does not retain a complete upstream harness configuration.Gemini 3.6 FlashExact identitySource label without a registered configuration ID Canonical product: gemini-3-6-flash | 83% | Source carriersource-checkedVersion & system2025 Source-native system | BenchLM public datasets — 2026-08-01Observed Checked |
From result to context
Evaluates computer-use agents in verified desktop interaction tasks.
The summary shows one best compatible source result per canonical product. Versions, effort settings and execution systems remain attached to the underlying records.
Scores from different versions or harnesses may not be interchangeable. The published source rows preserve those distinctions and their original units. A source result is not automatically an input to a current index.
This catalogue entry preserves available source evidence. Current indices admit only their specifically reviewed tracks and configurations.
Contamination risk: Unknown. Lifecycle: Active.