Finance Benchmark

Leaderboard / deepseek/deepseek-reasoner

deepseek-reasoner

deepseek · Tasks passed 84.9% · Finance Index 84.4

Tasks passed

84.9%

Overall accuracy

79.5%

Finance Index

84.4

Consistency

2.4/3 avg

Est. eval cost

$0.02

Median latency

Median output speed

Harness version
0.1.0
Task set
v2
Runs per task
3
Evaluated
6/15/2026, 10:43:31 AM
Run ID
c34f1f99-0d05-4bd6-b995-6e3a3bab1baa
Results file
Download JSON

Pass@1 by Difficulty

Easy

Medium

Hard

Scores by domain

Tasks passed (%) · top 1 models

Quant

Per-attempt drill-down requires a local result JSON in `results/`. Aggregate scores are shown from the published leaderboard.