Leaderboard / deepseek/deepseek-chat
deepseek-chat
deepseek · Tasks passed 60.3% · Finance Index 39.4
Tasks passed
60.3%
Overall accuracy
59.4%
Finance Index
39.4
Consistency
1.8/3 avg
Est. eval cost
$0.02
Median latency
—
Median output speed
—
- Harness version
- 0.1.0
- Task set
- v2
- Runs per task
- 3
- Evaluated
- 6/15/2026, 9:52:08 AM
- Run ID
- c4e5bb67-ca9f-4399-a3a4-2427c7f67150
- Results file
- Download JSON
Pass@1 by Difficulty
Easy
—
Medium
—
Hard
—
Scores by domain
Tasks passed (%) · top 1 models
Analysis
Per-attempt drill-down requires a local result JSON in `results/`. Aggregate scores are shown from the published leaderboard.