Finance Benchmark

Leaderboard / openai/gpt-5.3-codex

gpt-5.3-codex

openai · Tasks passed 65.9% · Finance Index 46.9

Tasks passed

65.9%

Overall accuracy

67.1%

Finance Index

46.9

Consistency

2.0/3 avg

Est. eval cost

$0.52

Median latency

1.4s

Median output speed

8 tok/s

Harness version
0.2.0
Task set
v2
Runs per task
3
Evaluated
7/15/2026, 9:13:00 PM
Run ID
3449f0a0-6ebf-4878-b53d-9f3af9672648
Results file
Download JSON

Pass@1 by Difficulty

Easy

Medium

Hard

Scores by domain

Tasks passed (%) · top 1 models

Quant

Per-attempt drill-down requires a local result JSON in `results/`. Aggregate scores are shown from the published leaderboard.