Leaderboard / openai/gpt-5.4
gpt-5.4
openai · Tasks passed 63.0% · Finance Index 40.6
Tasks passed
63.0%
Overall accuracy
62.1%
Finance Index
40.6
Consistency
1.9/3 avg
Est. eval cost
$0.53
Median latency
—
Median output speed
—
- Harness version
- 0.1.0
- Task set
- v2
- Runs per task
- 3
- Evaluated
- 6/15/2026, 7:25:03 AM
- Run ID
- 409d4e79-d03a-42c9-a4f1-51f3b9e5fff8
- Results file
- Download JSON
Pass@1 by Difficulty
Easy
—
Medium
—
Hard
—
Scores by domain
Tasks passed (%) · top 1 models
Analysis
Per-attempt drill-down requires a local result JSON in `results/`. Aggregate scores are shown from the published leaderboard.