Leaderboard
Bradley-Terry ratings from 8,198 pairwise human votes. Ties split the point; “both bad” carries no signal.
| # | Competitor | Rating | W | L | T | Games |
|---|---|---|---|---|---|---|
| 1 | GPT-5.5 (naive prompt) — benchmark | 1116 | 2418 | 867 | 93 | 3378 |
| 2 | Prompt v0 · baseline | 951 | 1234 | 2054 | 104 | 3392 |
| 3 | Prompt v2 · accuracy+clean | 933 | 957 | 1688 | 103 | 2748 |
By category
Characters & Mascots
GPT-5.5 (naive prompt) — benchmark
Rating 1206 · 650 games
Data Visualization
GPT-5.5 (naive prompt) — benchmark
Rating 1092 · 456 games
Technical Diagrams
GPT-5.5 (naive prompt) — benchmark
Rating 1124 · 641 games
Icons & Glyphs
Prompt v2 · accuracy+clean
Rating 1021 · 606 games
Logos & Wordmarks
GPT-5.5 (naive prompt) — benchmark
Rating 1198 · 387 games
Single Objects
GPT-5.5 (naive prompt) — benchmark
Rating 1156 · 588 games
Patterns & Textures
Prompt v2 · accuracy+clean
Rating 1065 · 356 games
Scenes & Illustrations
GPT-5.5 (naive prompt) — benchmark
Rating 1194 · 632 games
UI Mockups
GPT-5.5 (naive prompt) — benchmark
Rating 1145 · 443 games