Leaderboard / moonshot/kimi-k2.7-code
kimi-k2.7-code
moonshot · Tasks passed 80.8% · Finance Index 77.2
Tasks passed
80.8%
Overall accuracy
73.5%
Finance Index
77.2
Consistency
2.2/3 avg
Est. eval cost
$1.21
Median latency
21.2s
Median output speed
11 tok/s
- Harness version
- 0.2.0
- Task set
- v2
- Runs per task
- 3
- Evaluated
- 7/23/2026, 5:54:38 PM
- Run ID
- b729ff4c-e4df-4d0b-b212-0b767026fdab
- Results file
- Download JSON
Pass@1 by Difficulty
Easy
—
Medium
—
Hard
—
Scores by domain
Tasks passed (%) · top 1 models
Quant
Per-attempt drill-down requires a local result JSON in `results/`. Aggregate scores are shown from the published leaderboard.