A task with its own rules.
Stateful multi-step enterprise workflow agent benchmark graded on final database state across business domains.
- Organisation
- Artificial Analysis / ServiceNow
- Version
- Current / rolling
Agents / Benchmark profile
Stateful multi-step enterprise workflow agent benchmark graded on final database state across business domains.
Observed results
20 ranked models · higher is better · labels show rank and score
| Model | Rank | Model ID | Provider | Score | Unit |
|---|---|---|---|---|---|
| Claude Fable 5 | #1 | claude-fable-5 | Anthropic | 51.1191 | percent |
| Gemini 3.5 Flash | #2 | gemini-3-5-flash | 50.0746 | percent | |
| GPT-5.5 | #3 | gpt-5-5 | OpenAI | 46.6428 | percent |
| Kimi K3 | #4 | kimi-k3 | Moonshot AI | 45.3 | percent |
| Qwen3.7-Max | #5 | qwen-3-7-max | Alibaba Cloud | 45.0015 | percent |
| Claude Sonnet 5 | #6 | claude-sonnet-5 | Anthropic | 44.6732 | percent |
| Claude Opus 4.8 | #7 | claude-opus-4-8 | Anthropic | 43.957 | percent |
| GLM-5.2 | #8 | glm-5-2 | Z.AI | 42.7335 | percent |
| Gemini 3.1 Pro Preview | #9 | gemini-3-1-pro-preview | 42.1665 | percent | |
| Grok 4.5 | #10 | grok-4-5 | xAI | 40.8236 | percent |
| Qwen3.7-Plus | #11 | qwen-3-7-plus | Alibaba Cloud | 40.5551 | percent |
| DeepSeek V4 Pro | #12 | deepseek-v4-pro | DeepSeek | 40.4357 | percent |
| Kimi K2.7 Code | #13 | kimi-k2-7-code | Moonshot AI | 40.2268 | percent |
| DeepSeek V4 Flash | #14 | deepseek-v4-flash | DeepSeek | 39.5703 | percent |
| Kimi K2.6 | #15 | kimi-k2-6 | Moonshot AI | 38.5258 | percent |
| GPT-5.4 mini | #16 | gpt-5-4-mini | OpenAI | 34.6165 | percent |
| Mistral Medium 3.5 | #17 | mistral-medium-3-5 | Mistral AI | 33.7213 | percent |
| MiniMax M3 | #18 | minimax-m3 | MiniMax | 32.1098 | percent |
| GPT-5.4 nano | #19 | gpt-5-4-nano | OpenAI | 31.4831 | percent |
| Qwen3.5 397B A17B | #20 | qwen3-5-397b | Alibaba Cloud | 30.8863 | percent |
| Claude Haiku 4.5 | #21 | claude-haiku-4-5 | Anthropic | 29.3942 | percent |
| Nemotron 3 Ultra | #22 | nemotron-3-ultra | NVIDIA | 28.8869 | percent |
| Gemma 4 31B | #23 | gemma-4-31b | 28.3497 | percent | |
| Gemini 3.1 Flash-Lite | #24 | gemini-3-1-flash-lite | 28.0215 | percent | |
| Grok 4.3 | #25 | grok-4-3 | xAI | 26.2608 | percent |
One best compatible score per canonical product · higher is better
| Rank | Model | Weights | Evidence | Score |
|---|---|---|---|---|
| 01 | Claude Fable 5Anthropic | Closed weights | Direct source result | 51.1% |
| 02 | Gemini 3.5 FlashGoogle | Closed weights | Direct source result | 50.1% |
| 03 | GPT-5.5OpenAI | Closed weights | Direct source result | 46.6% |
| 04 | Kimi K3Moonshot AI | Open weights | Direct source result | 45.3% |
| 05 | Qwen3.7-MaxAlibaba Cloud | Closed weights | Direct source result | 45.0% |
| 06 | Claude Sonnet 5Anthropic | Closed weights | Direct source result | 44.7% |
| 07 | Claude Opus 4.8Anthropic | Closed weights | Direct source result | 44.0% |
| 08 | GLM-5.2Z.AI | Open weights | Direct source result | 42.7% |
| 09 | Gemini 3.1 Pro PreviewGoogle | Closed weights | Direct source result | 42.2% |
| 10 | Grok 4.5xAI | Closed weights | Direct source result | 40.8% |
Each distinct published measurement is retained. Same-snapshot canonical and configuration projections appear once.
| Published model / configuration | Score | Evidence & protocol | Source & dates |
|---|---|---|---|
Kimi K3; Artificial Analysis EnterpriseOps-Gym-AA evaluation.Kimi K3Exact identitySource label without a registered configuration ID Canonical product: kimi-k3 | 45.3% | Direct source resultsource-checkedVersion & systemCurrent Artificial Analysis independent evaluation | Kimi K3 Intelligence, Performance & Price AnalysisObserved Checked |
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Claude Fable 5Exact identityclaude-fable-5-max Canonical product: claude-fable-5 | 51.1% | Public referencesource-checkedVersion & systemCurrent Artificial Analysis independent evaluation | EnterpriseOps-Gym-AA LeaderboardObserved Checked |
Gemini 3.5 Flash (high)Gemini 3.5 FlashExact identitygemini-3-5-flash-high Canonical product: gemini-3-5-flash | 50.1% | Public referencesource-checkedVersion & systemCurrent Artificial Analysis independent evaluation | EnterpriseOps-Gym-AA LeaderboardObserved Checked |
GPT-5.5 (xhigh)GPT-5.5Exact identitygpt-5-5-xhigh Canonical product: gpt-5-5 | 46.6% | Public referencesource-checkedVersion & systemCurrent Artificial Analysis independent evaluation | EnterpriseOps-Gym-AA LeaderboardObserved Checked |
Qwen3.7 MaxQwen3.7-MaxExact identitySource label without a registered configuration ID Canonical product: qwen-3-7-max | 45.0% | Direct source resultsource-checkedVersion & systemCurrent Artificial Analysis independent evaluation | EnterpriseOps-Gym-AA LeaderboardObserved Checked |
Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Claude Sonnet 5Exact identityclaude-sonnet-5-max Canonical product: claude-sonnet-5 | 44.7% | Public referencesource-checkedVersion & systemCurrent Artificial Analysis independent evaluation | EnterpriseOps-Gym-AA LeaderboardObserved Checked |
Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Claude Opus 4.8Exact identityclaude-opus-4-8-max Canonical product: claude-opus-4-8 | 44.0% | Public referencesource-checkedVersion & systemCurrent Artificial Analysis independent evaluation | EnterpriseOps-Gym-AA LeaderboardObserved Checked |
GLM-5.2 (max)GLM-5.2Exact identityglm-5-2-max Canonical product: glm-5-2 | 42.7% | Public referencesource-checkedVersion & systemCurrent Artificial Analysis independent evaluation | EnterpriseOps-Gym-AA LeaderboardObserved Checked |
Gemini 3.1 Pro PreviewGemini 3.1 Pro PreviewExact identitySource label without a registered configuration ID Canonical product: gemini-3-1-pro-preview | 42.2% | Direct source resultsource-checkedVersion & systemCurrent Artificial Analysis independent evaluation | EnterpriseOps-Gym-AA LeaderboardObserved Checked |
Grok 4.5 (high)Grok 4.5Exact identitySource label without a registered configuration ID Canonical product: grok-4-5 | 40.8% | Direct source resultsource-checkedVersion & systemCurrent Artificial Analysis independent evaluation | EnterpriseOps-Gym-AA LeaderboardObserved Checked |
From result to context
Stateful multi-step enterprise workflow agent benchmark graded on final database state across business domains.
The summary shows one best compatible source result per canonical product. Versions, effort settings and execution systems remain attached to the underlying records.
Scores from different versions or harnesses may not be interchangeable. The published source rows preserve those distinctions and their original units. A source result is not automatically an input to a current index.
A reviewed track from this benchmark is represented in the following current indices. Each index applies its own protocol and eligibility rules.
Contamination risk: Unknown. Lifecycle: Active.