Finance Benchmark

Leaderboard / openai/gpt-5.4

gpt-5.4

openai · Tasks passed 63.0% · Finance Index 40.6

Tasks passed

63.0%

Overall accuracy

62.1%

Finance Index

40.6

Consistency

1.9/3 avg

Est. eval cost

$0.53

Median latency

Median output speed

Harness version
0.1.0
Task set
v2
Runs per task
3
Evaluated
6/15/2026, 7:25:03 AM
Run ID
409d4e79-d03a-42c9-a4f1-51f3b9e5fff8
Results file
Download JSON

Pass@1 by Difficulty

Easy

Medium

Hard

Scores by domain

Tasks passed (%) · top 1 models

Analysis

Per-attempt drill-down requires a local result JSON in `results/`. Aggregate scores are shown from the published leaderboard.