Finance Benchmark

Leaderboard / openai/gpt-5.6-luna

gpt-5.6-luna

openai · Tasks passed 90.4% · Finance Index 92.2

Tasks passed

90.4%

Overall accuracy

87.7%

Finance Index

92.2

Consistency

2.6/3 avg

Est. eval cost

$0.98

Median latency

2.3s

Median output speed

79 tok/s

Harness version
0.2.0
Task set
v2
Runs per task
3
Evaluated
7/25/2026, 4:35:10 PM
Run ID
b44e7fb3-93b4-4c5a-bfff-0faa913214dc
Results file
Download JSON

Pass@1 by Difficulty

Easy

Medium

Hard

Scores by domain

Tasks passed (%) · top 1 models

Quant

Per-attempt drill-down requires a local result JSON in `results/`. Aggregate scores are shown from the published leaderboard.