Reasoning
Mathematical and scientific problem solving.
Model profile / Moonshot AI
Kimi K2 Thinking is tracked via Artificial Analysis independent evaluations for capability comparison across coding, agents, reasoning and related workloads.
Four areas of evidence
Mathematical and scientific problem solving.
Software engineering and programming.
Factual reliability and instruction following.
Tool use, workflows and professional tasks.
Current index snapshot · 2026-09-16. Each category uses its own scale; scores across categories are not directly comparable. Counts describe published catalogue evidence. A point lead does not establish superiority.
Performance in context
Kimi K2 Thinking has no current Capabilities rating. Explore the rated models below.
Lumina Capabilities Index
The current Capabilities cohort, with available operational measurements.
Chart loads as you explore
Lumina Capabilities Index
The current Capabilities cohort, with available operational measurements.
Chart loads as you explore
Explore the detail
No current index estimate. Available benchmark measurements and source records are retained below.
| Benchmark | Result | Published configuration | Source |
|---|---|---|---|
| GPQA Diamond1.0.1 | 84.217% | Kimi K2 Thinking TurboEpoch AI benchmark runner | Epoch AI permanent refresh source ↗Observed 2025-11-11 · checked 2026-08-17source-checked · excluded |
| AA Long Context ReasoningSource-native version | 66.333% | Kimi K2 ThinkingArtificial Analysis independent evaluation | AA Long Context Reasoning Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15source-checked · reference-only |
| AA-OmniscienceSource-native version | -20.483 index | Kimi K2 ThinkingArtificial Analysis independent evaluation | AA-Omniscience Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15source-checked · reference-only |
| CritPtSource-native version | 2.571% | Kimi K2 ThinkingArtificial Analysis independent evaluation | CritPt Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15source-checked · ranking-eligible |
| τ²-Bench TelecomSource-native version | 92.983% | Kimi K2 ThinkingArtificial Analysis independent evaluation | τ²-Bench Telecom Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15source-checked · reference-only |
| Terminal-Bench HardSource-native version | 31.061% | Kimi K2 ThinkingArtificial Analysis independent evaluation | Terminal-Bench Hard Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15source-checked · reference-only |
| SciCodeSource-native version | 42.361% | Kimi K2 ThinkingArtificial Analysis independent evaluation | Artificial Analysis Models Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15source-checked · reference-only |
| Humanity's Last ExamSource-native version | 22.336% | Kimi K2 ThinkingArtificial Analysis independent evaluation | Artificial Analysis Models Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15source-checked · reference-only |
| GPQA DiamondSource-native version | 83.838% | Kimi K2 ThinkingArtificial Analysis independent evaluation | Artificial Analysis Models Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15source-checked · reference-only |
| LiveCodeBenchSource-native version | 85.291% | Kimi K2 ThinkingArtificial Analysis independent evaluation | Artificial Analysis Models Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15source-checked · reference-only |