GPT-OSS 120B
6.4free tier1 run per challengeavg 8580msjudged by claude-sonnet-5
Every challenge this model has run, with the full paper trail — click into any row to read the raw response the judge scored.
13 challenges · best to worst
refactor
9.3correctness 10.0quality 9.0documentation 9.030914msinspect trace →
readme-writer
9.0correctness 9.0quality 9.0documentation 9.032506msinspect trace →
sql
9.0correctness 9.0quality 9.0documentation 9.02445msinspect trace →
go-test
8.7correctness 9.0quality 8.0documentation 9.01740msinspect trace →
binary-search
8.3correctness 9.0quality 8.0documentation 8.03700msinspect trace →
fizzbuzz
8.0correctness 9.0quality 8.0documentation 7.01640msinspect trace →
async-fetch
7.7correctness 6.0quality 8.0documentation 9.03368msinspect trace →
debug
6.7correctness 6.0quality 7.0documentation 7.05210msinspect trace →
test-writing
6.3correctness 5.0quality 7.0documentation 7.02854msinspect trace →
elixir-test
4.7correctness 3.0quality 6.0documentation 5.02529msinspect trace →
api-client
3.7correctness 1.0quality 4.0documentation 6.03251msinspect trace →
doom
0.7correctness 0.0quality 1.0documentation 1.012192msinspect trace →
slots
0.7correctness 0.0quality 1.0documentation 1.09193msinspect trace →