Reasoning
Mathematical and scientific problem solving.
Model profile / Moonshot AI
Moonshot AI's officially documented multimodal Kimi model; unverified K3 reports are excluded from this registry.
Four areas of evidence
Mathematical and scientific problem solving.
Software engineering and programming.
Factual reliability and instruction following.
Score includes qualified prediction of missing evidence.
Tool use, workflows and professional tasks.
Current index snapshot · 2026-09-16. Each category uses its own scale; scores across categories are not directly comparable. Evidence counts describe the retained Capabilities inputs; a family can contain several tasks or configurations. A point lead does not establish superiority.
Performance in context
Kimi K2.5 is highlighted wherever a compatible measurement is available.
Kimi K2.5: Kimi K2.5 API retired 2026-08-31; historical price is not a current endpoint quote
Lumina Capabilities Index
The current Capabilities cohort, with this model highlighted.
Chart loads as you explore
Kimi K2.5: No exact base-profile release and documented 10K output measurement; other effort/protocol/alias records not substituted
Lumina Capabilities Index
The current Capabilities cohort, with this model highlighted.
Chart loads as you explore
Explore the detail
Score uses the admitted direct native evidence under the selected method.
Score includes qualified prediction of missing evidence.
| Benchmark | Result | Published configuration | Source |
|---|---|---|---|
| AA Long Context Reasoningstandard | 73% | Kimi K2.5 (Reasoning) (Artificial Analysis completed independent run)Artificial Analysis AA-LCR evaluation | Kimi K2.5 (Reasoning) current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29independently-verified · ranking-eligible |
| CritPtstandard | 3.143% | Kimi K2.5 (Reasoning) (Artificial Analysis completed independent run)Artificial Analysis CritPt evaluation | Kimi K2.5 (Reasoning) current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29independently-verified · ranking-eligible |
| GDPval-AA v2v2 | 25.285% | Kimi K2.5 (Reasoning) (Artificial Analysis completed independent run)Artificial Analysis GDPval-AA v2 | Kimi K2.5 (Reasoning) current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29independently-verified · ranking-eligible |
| GPQA Diamonddiamond | 87.879% | Kimi K2.5 (Reasoning) (Artificial Analysis completed independent run)Artificial Analysis GPQA Diamond evaluation | Kimi K2.5 (Reasoning) current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29independently-verified · ranking-eligible |
| Humanity's Last Examtext-only current | 30.723% | Kimi K2.5 (Reasoning) (Artificial Analysis completed independent run)Artificial Analysis text-only HLE evaluation | Kimi K2.5 (Reasoning) current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29independently-verified · ranking-eligible |
| SciCode2024 | 48.958% | Kimi K2.5 (Reasoning) (Artificial Analysis completed independent run)Artificial Analysis SciCode evaluation | Kimi K2.5 (Reasoning) current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29independently-verified · reference-only |
| τ³-Banking3 | 14.227% | Kimi K2.5 (Reasoning) (Artificial Analysis completed independent run)Artificial Analysis tau3-Banking evaluation | Kimi K2.5 (Reasoning) current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29independently-verified · ranking-eligible |
| Terminal-Bench2.1 | 45.693% | Kimi K2.5 (Reasoning) (Artificial Analysis completed independent run)Artificial Analysis Terminal-Bench v2.1 in e2b | Kimi K2.5 (Reasoning) current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29independently-verified · ranking-eligible |
| Artificial Analysis Agentic Index2026 | 21.69 index | Exact BenchLM registry variant Kimi K2.5; bulk export does not retain a complete upstream harness configuration.Source-native system | BenchLM public datasets — 21 July 2026 ↗Observed 2026-07-21 · checked 2026-07-21source-checked · reference-only |
| Artificial Analysis Agentic Index2026 | 21.69 index | Exact BenchLM registry variant Kimi K2.5; bulk export does not retain a complete upstream harness configuration.Source-native system | BenchLM public datasets — 2026-07-27 ↗Observed 2026-07-27 · checked 2026-07-27source-checked · reference-only |
Specialist evidence
Source-native operational evidence for Kimi K2.5. Exact configurations remain separate. Costs are comparable only within the same selected benchmark/evaluation, and these rows never enter Overall Score.
| Evaluation | Exact configuration | Performance | Cost / task | Tokens / task | Execution |
|---|---|---|---|---|---|
| SWE-bench Owner Leaderboards · owner-current · multilingual SWE-bench Owner Leaderboards · checked 2026-08-29 | kimi-k2-5-thinking Kimi K2.5 | 67.3% | $0.693 | — | 50.4 calls |