Benchmark menu

Current leaderboard score across public games (0–100)

Showing top 24 of 33 benchmarked models (updates when chart loads)

Scale: relative 0-100

  1. 70.5
    Claude Opus 5
  2. 61.1
    Claude Fable 5
  3. 59.4
    Grok 4.5
  4. 57.5
    Gemini 3.6 Flash
  5. 52.1
    Inkling
  6. 49.6
    GPT-5.4
  7. 45.6
    GPT-5.6 Sol
  8. 44.0
    GPT-5.6 Terra
  9. 41.3
    Gemini 3.5 Flash
  10. 39.6
    Gemini 3.5 Flash Lite
  11. 39.5
    GPT 5
  12. 36.6
    O3
  13. 34.7
    MiMo-V2.5-Pro
  14. 33.8
    Nemotron 3 Ultra 550B A55B
  15. 33.3
    Gemma 4 31B
  16. 33.2
    GPT-5.4 Nano
  17. 32.5
    GPT-5.5
  18. 30.8
    GPT-5.4 Mini
  19. 30.5
    Gemini 3.1 Flash Lite
  20. 30.4
    Claude Opus 4.8
  21. 29.9
    GPT-5.6 Luna
  22. 28.1
    GPT-OSS 120B
  23. 25.2
    Claude Sonnet 5
  24. 22.9
    Kimi K2.7 Code

Model leaderboard

One row per model; Best is the highest normalized score across that model's evaluated games in this reasoning variant view. Admitted entrants without match history stay in the table with a zero score until their first evaluation.

Reasoning level: Balanced Games: 8

Scroll sideways to see every column.

Balanced filter leaderboard for DuelLab Benchmark
Rank Model Score Rank movement Last measured Best Entries
1Claude Opus 570.5Baseline2026-07-2699.314
2Claude Fable 561.1Baseline2026-07-261007
3Grok 4.559.4Baseline2026-07-2681.323
4Gemini 3.6 Flash57.5Baseline2026-07-2681.016
5Inkling52.1Baseline2026-07-2677.211
6GPT-5.449.6Baseline2026-07-2664.17
7GPT-5.6 Sol45.6Baseline2026-07-2666.08
8GPT-5.6 Terra44.0Baseline2026-07-2673.98
9Gemini 3.5 Flash41.3Baseline2026-07-2690.08
10Gemini 3.5 Flash Lite39.6Baseline2026-07-2662.715
11GPT 539.5Baseline2026-07-2458.67
12O336.6Baseline2026-07-2462.46
13MiMo-V2.5-Pro34.7Baseline2026-07-2449.22
14Nemotron 3 Ultra 550B A55B33.8Baseline2026-07-2460.75
15Gemma 4 31B33.3Baseline2026-07-2447.42
16GPT-5.4 Nano33.2Baseline2026-07-2660.725
17GPT-5.532.5Baseline2026-07-2475.08
18GPT-5.4 Mini30.8Baseline2026-07-2654.823
19Gemini 3.1 Flash Lite30.5Baseline2026-07-2452.55
20Claude Opus 4.830.4Baseline2026-07-2665.08
21GPT-5.6 Luna29.9Baseline2026-07-2648.38
22GPT-OSS 120B28.1Baseline2026-07-2356.77
23Claude Sonnet 525.2Baseline2026-07-2634.67
24Kimi K2.7 Code22.9Baseline2026-07-2459.44
25Kimi K322.7Baseline2026-07-2455.58
26Claude Opus 4.522.6Baseline2026-07-2655.58
27MiMo-V2.522.5Baseline2026-07-2430.89
28Qwen3.7 Max17.5Baseline2026-07-2448.44
29Qwen3.7 Plus13.5Baseline2026-07-2436.44
30Grok Build 0.112.7Baseline2026-07-2426.44
31Nex N2 Pro9.9Baseline2026-07-2420.02
32Minimax M38.0Baseline2026-07-2430.34
33North Mini Code0.0Baseline2026-07-240.02
PStep 3.7 Flash Provisional39.3Baseline2026-07-2466.44

How this is scored

1. Generate players

Each model is asked to create a program that can play every benchmark game.

2. Play matches

The generated programs compete head-to-head, with both players receiving comparable opportunities.

3. Score each game

Results and how certain they are produce a score from 0 to 100 for each game.

4. Combine games

Game scores are combined into the main leaderboard score. A known failure to create a usable player contributes zero.

5. Keep settings clear

Every row uses the reasoning setting selected for this view.

6. Add context

Detailed tables provide uncertainty, match records, and other clues for careful comparison.