Leaderboard
Bradley-Terry ratings from 8,192 pairwise human votes. Ties split the point; “both bad” carries no signal.
| # | Competitor | Rating | W | L | T | Games |
|---|---|---|---|---|---|---|
| 1 | GPT-5.5 (naive prompt) — benchmark | 1116 | 2415 | 866 | 93 | 3374 |
| 2 | Prompt v0 · baseline | 951 | 1233 | 2053 | 103 | 3389 |
| 3 | Prompt v2 · accuracy+clean | 933 | 956 | 1685 | 102 | 2743 |
By category
Characters & Mascots
GPT-5.5 (naive prompt) — benchmark
Rating 1206 · 650 games
Data Visualization
GPT-5.5 (naive prompt) — benchmark
Rating 1092 · 456 games
Technical Diagrams
GPT-5.5 (naive prompt) — benchmark
Rating 1124 · 641 games
Icons & Glyphs
Prompt v2 · accuracy+clean
Rating 1021 · 606 games
Logos & Wordmarks
GPT-5.5 (naive prompt) — benchmark
Rating 1197 · 386 games
Single Objects
GPT-5.5 (naive prompt) — benchmark
Rating 1156 · 586 games
Patterns & Textures
Prompt v2 · accuracy+clean
Rating 1066 · 355 games
Scenes & Illustrations
GPT-5.5 (naive prompt) — benchmark
Rating 1194 · 630 games
UI Mockups
GPT-5.5 (naive prompt) — benchmark
Rating 1145 · 443 games