Benchmark menu

Per-game leaderboard

GB2-03: Shogi

This page shows the per-game leaderboard for GB2-03: Shogi in the balanced filter. Entrants are ranked by their relative per-game score within this game.

GB2-03: Shogi

Shogi

Shogi is a 9x9 chess-family game with promotion zones, captured-piece drops, repetition handling, and impasse scoring.

Scores here compare generated programs on DuelLab's encoded rules for Shogi; they are not a broad measure of human play strength.

Entrants

Every admitted unique code identity for GB2-03: Shogi. Elo and W/L/D use the public historical sequential-Elo result universe. Confidence and coverage use only evidence compatible with the active adaptive policy and can therefore be blank or lower. Capped draws are rated; unilateral model faults are listed separately.

Showing 31 entrants.
EntrantModelStatusScoreEloConfidenceW / L / DRated / attemptedOpponentsCapped drawsFaults / pluginsGeneration
E-dfb18dba94eee30bClaude Opus 4.5Under-covered5.914840 / 1 / 12 / 2100 / 1First pass · —
E-823b961281482cd1Claude Opus 4.8Under-covered27.714861 / 2 / 14 / 4200 / 1First pass · 2026-07-02
E-bd02f4c2907d0a7cClaude Opus 5Under-covered100.015959 / 3 / 012 / 12600 / 1First pass · 2026-07-25
E-d8babc5495b1a188Claude Opus 5Under-covered98.616019 / 1 / 010 / 10500 / 1First pass · 2026-07-25
E-0f669ae82234cf76North Mini CodePending0 / 0 / 00 / 0000 / 1Repaired · 2026-07-02
E-8ed795ea8fd1e0aaGemini 3.5 FlashUnder-covered18.414630 / 3 / 14 / 4200 / 1Repaired · 2026-07-02
E-36e89f1dca2cd568Gemini 3.5 Flash LiteUnder-covered59.515053 / 2 / 510 / 10520 / 1Repaired · 2026-07-24
E-e51f710b50e975e5Gemini 3.5 Flash LiteUnder-covered29.714452 / 6 / 08 / 8400 / 1Repaired · 2026-07-24
E-9b5d467ecf278026Gemini 3.6 FlashUnder-covered53.814823 / 5 / 412 / 12600 / 1Repaired · 2026-07-24
E-f44c7c8e627e08cdGemini 3.6 FlashUnder-covered47.014754 / 5 / 110 / 10500 / 1Repaired · 2026-07-24
E-e724ba162431d43aGPT 5Under-covered39.714700 / 2 / 68 / 8400 / 1First pass · 2026-07-02
E-496f83ad0bd69447GPT-5.4Pending0 / 0 / 00 / 0000 / 1First pass · 2026-07-02
E-3e164d6fc6c16cbbGPT-5.4 MiniUnder-covered18.315151 / 0 / 12 / 2100 / 1First pass · 2026-07-01
E-7cbcc752e71e2d3bGPT-5.4 MiniUnder-covered51.614991 / 1 / 68 / 8420 / 1First pass · 2026-07-02
E-9e39bdd48b7328c7GPT-5.4 MiniUnder-covered11.914990 / 0 / 22 / 2120 / 1Repaired · 2026-07-02
E-0ad5302188ed9e2fGPT-5.4 NanoUnder-covered0.014690 / 2 / 02 / 2100 / 1First pass · 2026-07-01
E-c002b0ea38b845f8GPT-5.5Under-covered46.015312 / 0 / 24 / 4200 / 1First pass · 2026-07-02
E-0300c20cb034e3a4GPT-5.6 LunaUnder-covered28.214870 / 1 / 34 / 4220 / 1First pass · 2026-07-10
E-b741de451c385e8eGPT-5.6 SolUnder-covered50.515143 / 2 / 16 / 6300 / 1First pass · 2026-07-10
E-e44c62bb88a3042aGPT-5.6 TerraUnder-covered59.615181 / 0 / 78 / 8400 / 1First pass · 2026-07-10
E-3dc5f5cc9bb215b7LongCat 2.0Pending0 / 0 / 00 / 0000 / 1Repaired · 2026-07-24
E-0d3d2270a391a708Kimi K3Under-covered18.915161 / 0 / 12 / 2100 / 1Repaired · 2026-07-21
E-b97350a867368460Kimi K3Pending0 / 0 / 00 / 0000 / 1Repaired · 2026-07-24
E-57ad2863cbf32d58Nex N2 ProPending0 / 0 / 00 / 0000 / 1Repaired · 2026-07-02
E-87b4bd61da369b42GPT-OSS 120BUnder-covered21.514700 / 2 / 24 / 4200 / 1Repaired · 2026-07-02
E-08762a3df1a52f6bLaguna S 2.1Pending0 / 0 / 00 / 0000 / 1First pass · 2026-07-24
E-936fb7956df3d03bLaguna S 2.1Pending0 / 0 / 00 / 0000 / 1Repaired · 2026-07-24
E-09ef87ab56d05a09Grok 4.5Under-covered25.114510 / 4 / 26 / 6300 / 1Repaired · 2026-07-17
E-cbed46472ce4dd05Grok 4.5Under-covered58.015143 / 2 / 38 / 8410 / 1First pass · 2026-07-24
E-d5ed477108214e1cGrok 4.5Under-covered56.715112 / 1 / 58 / 8430 / 1First pass · 2026-07-17
E-2a93343a8a88fd59Grok Build 0.1Pending0 / 0 / 00 / 0000 / 1Repaired · 2026-07-02

GB2-03: Shogi leaderboard

Entrants are ranked by relative per-game score (0–100). Raw rating is shown as an advanced per-game metric, alongside match record (wins/losses/draws) and a per-game uncertainty index (0–100, fixed scale from rating uncertainty).

Reasoning level: Balanced Game: GB2-03: Shogi

Scroll sideways to see every column.

GB2-03: Shogi - Balanced filter
Rank Model Score Contributing programs Raw Elo W / L / D Uncertainty
1Claude Opus 5100.011595.49/3/094.9
2Claude Opus 598.611601.59/1/0100.0
3GPT-5.6 Terra59.611518.41/0/7100.0
4Gemini 3.5 Flash Lite59.511505.43/2/5100.0
5Grok 4.558.011514.43/2/3100.0
6Grok 4.556.711511.42/1/5100.0
7Gemini 3.6 Flash53.811481.83/5/494.9
8GPT-5.4 Mini51.611498.71/1/6100.0
9GPT-5.6 Sol50.511514.03/2/1100.0
10Gemini 3.6 Flash47.011474.74/5/1100.0
11GPT-5.546.011530.52/0/2100.0
12GPT 539.711469.50/2/6100.0
13Gemini 3.5 Flash Lite29.711445.02/6/0100.0
14GPT-5.6 Luna28.211486.70/1/3100.0
15Claude Opus 4.827.711485.61/2/1100.0
16Grok 4.525.111451.40/4/2100.0
17GPT-OSS 120B21.511470.20/2/2100.0
18Kimi K318.911516.01/0/1100.0
19Gemini 3.5 Flash18.411462.80/3/1100.0
20GPT-5.4 Mini18.311514.51/0/1100.0
21GPT-5.4 Mini11.911498.70/0/2100.0
22Claude Opus 4.55.911484.00/1/1100.0
23GPT-5.4 Nano0.011469.50/2/0100.0