Leaderboard / openai/gpt-5.6-luna
gpt-5.6-luna
openai · Tasks passed 90.4% · Finance Index 92.2
Tasks passed
90.4%
Overall accuracy
87.7%
Finance Index
92.2
Consistency
2.6/3 avg
Est. eval cost
$0.98
Median latency
2.3s
Median output speed
79 tok/s
- Harness version
- 0.2.0
- Task set
- v2
- Runs per task
- 3
- Evaluated
- 7/25/2026, 4:35:10 PM
- Run ID
- b44e7fb3-93b4-4c5a-bfff-0faa913214dc
- Results file
- Download JSON
Pass@1 by Difficulty
Easy
—
Medium
—
Hard
—
Scores by domain
Tasks passed (%) · top 1 models
Quant
Per-attempt drill-down requires a local result JSON in `results/`. Aggregate scores are shown from the published leaderboard.