Leaderboard / google/gemini-2.5-pro
gemini-2.5-pro
google · Tasks passed 84.9% · Finance Index 80.6
Tasks passed
84.9%
Overall accuracy
79.5%
Finance Index
80.6
Consistency
2.4/3 avg
Est. eval cost
$0.75
Median latency
—
Median output speed
—
- Harness version
- 0.1.0
- Task set
- v2
- Runs per task
- 3
- Evaluated
- 6/15/2026, 9:03:02 AM
- Run ID
- 5d574048-26bd-470e-a7d1-5389e339868e
- Results file
- Download JSON
Pass@1 by Difficulty
Easy
—
Medium
—
Hard
—
Scores by domain
Tasks passed (%) · top 1 models
Quant
Per-attempt drill-down requires a local result JSON in `results/`. Aggregate scores are shown from the published leaderboard.