Leaderboard / openai/gpt-5.3-codex
gpt-5.3-codex
openai · Tasks passed 65.9% · Finance Index 46.9
Tasks passed
65.9%
Overall accuracy
67.1%
Finance Index
46.9
Consistency
2.0/3 avg
Est. eval cost
$0.52
Median latency
1.4s
Median output speed
8 tok/s
- Harness version
- 0.2.0
- Task set
- v2
- Runs per task
- 3
- Evaluated
- 7/15/2026, 9:13:00 PM
- Run ID
- 3449f0a0-6ebf-4878-b53d-9f3af9672648
- Results file
- Download JSON
Pass@1 by Difficulty
Easy
—
Medium
—
Hard
—
Scores by domain
Tasks passed (%) · top 1 models
Quant
Per-attempt drill-down requires a local result JSON in `results/`. Aggregate scores are shown from the published leaderboard.