Claude Sonnet 4.6
6.2paid tier1 run per challengeavg 33426msjudged by claude-sonnet-5
Every challenge this model has run, with the full paper trail — click into any row to read the raw response the judge scored.
13 challenges · best to worst
fizzbuzz
9.7correctness 10.0quality 9.0documentation 10.013689msinspect trace →
readme-writer
9.0correctness 9.0quality 9.0documentation 9.026268msinspect trace →
refactor
9.0correctness 9.0quality 9.0documentation 9.015452msinspect trace →
binary-search
8.7correctness 9.0quality 8.0documentation 9.030328msinspect trace →
async-fetch
8.3correctness 8.0quality 8.0documentation 9.029212msinspect trace →
elixir-test
8.0correctness 8.0quality 7.0documentation 9.023942msinspect trace →
sql
6.7correctness 8.0quality 6.0documentation 6.016174msinspect trace →
test-writing
5.3correctness 3.0quality 5.0documentation 8.028558msinspect trace →
debug
5.3correctness 6.0quality 5.0documentation 5.024025msinspect trace →
go-test
5.3correctness 4.0quality 5.0documentation 7.018838msinspect trace →
api-client
3.7correctness 2.0quality 5.0documentation 4.037832msinspect trace →
doom
1.0correctness 1.0quality 1.0documentation 1.088291msinspect trace →
slots
0.0correctness 0.0quality 0.0documentation 0.081929msinspect trace →