Directory filters
Find models
48 models shown.
Models
Browse models
Models appear in leaderboard order. Open a model to see its scores, program results, cost, and test setup.
| Rank | Model | Provider | Score | Rank change | Reasoning settings | Player program results | Test setup | Last tested | Status | Actions |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 | Anthropic | 74.7 | Baseline | IntensiveBalancedBaseline | XHigh: 63% / 37% / 0% · n 8Medium: 88% / 0% / 12% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | Partial 2/3Missing Baseline | DetailsCharts |
| 2 | Claude Opus 5 | Anthropic | 72.6 | Baseline | IntensiveBalancedBaseline | XHigh: 81% / 0% / 19% · n 16Medium: 88% / 0% / 12% · n 16Thinking disabled: 88% / 0% / 12% · n 16 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-15 | All settings tested | DetailsCharts |
| 3 | GPT-5.6 Sol | OpenAI | 69.9 | Baseline | IntensiveBalancedBaseline | XHigh: 88% / 12% / 0% · n 8Medium: 100% / 0% / 0% · n 8None: 100% / 0% / 0% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-23 | All settings tested | DetailsCharts |
| 4 | GPT-5.4 | OpenAI | 57.0 | Baseline | IntensiveBalancedBaseline | XHigh: 88% / 0% / 12% · n 8Medium: 100% / 0% / 0% · n 8None: 75% / 25% / 0% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-23 | All settings tested | DetailsCharts |
| 5 | Grok 4.5 | xAI | 55.2 | Baseline | IntensiveBalancedBaseline | High: 75% / 25% / 0% · n 8Medium: 88% / 12% / 0% · n 8Low: 88% / 12% / 0% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-23 | All settings tested | DetailsCharts |
| 6 | Claude Opus 4.8 | Anthropic | 53.9 | Baseline | IntensiveBalancedBaseline | XHigh: 75% / 13% / 12% · n 8Medium: 100% / 0% / 0% · n 8Thinking field omitted: 88% / 0% / 12% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | All settings tested | DetailsCharts |
| 7 | GPT-5.5 | OpenAI | 53.3 | Baseline | IntensiveBalancedBaseline | XHigh: 88% / 0% / 12% · n 8Medium: 88% / 12% / 0% · n 8None: 88% / 0% / 12% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | All settings tested | DetailsCharts |
| 8 | Gemini 3.6 Flash | 52.3 | Baseline | IntensiveBalancedBaseline | High: 50% / 25% / 25% · n 16Medium: 88% / 0% / 12% · n 16Minimal: 75% / 25% / 0% · n 16 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-23 | All settings testedMany programs failed | DetailsCharts | |
| 9 | Gemini 3.5 Flash | 51.3 | Baseline | IntensiveBalancedBaseline | High: 0% / 75% / 25% · n 8Medium: 0% / 100% / 0% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | Partial 2/3Missing BaselineMany programs needed repairMany programs failed | DetailsCharts | |
| 10 | Kimi K3 | Moonshot | 50.0 | Baseline | IntensiveBalancedBaseline | Max: 14% / 57% / 29% · n 7High: 88% / 12% / 0% · n 8Low: 88% / 12% / 0% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-22 | Partial 3/3All settings testedMany programs needed repairMany programs failed | DetailsCharts |
| 11 | Muse Spark 1.2 | Other | 48.3 | Baseline | IntensiveBalancedBaseline | XHigh: 100% / 0% / 0% · n 2Medium: 88% / 0% / 12% · n 8Minimal: 88% / 12% / 0% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-23 | Partial 3/3All settings tested | DetailsCharts |
| 12 | Claude Opus 4.5 | Anthropic | 48.1 | Baseline | IntensiveBalancedBaseline | High effort + 32,000 thinking tokens: 100% / 0% / 0% · n 8Medium effort + 16,000 thinking tokens: 100% / 0% / 0% · n 8Thinking field omitted: 100% / 0% / 0% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-21 | Partial 3/3All settings tested | DetailsCharts |
| 13 | GPT-5.6 Terra | OpenAI | 47.6 | Baseline | IntensiveBalancedBaseline | XHigh: 63% / 37% / 0% · n 8Medium: 63% / 37% / 0% · n 8None: 78% / 11% / 11% · n 9 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | All settings tested | DetailsCharts |
| 14 | GLM-5.2 | Zhipu | 46.4 | Baseline | IntensiveBalancedBaseline | XHigh: 100% / 0% / 0% · n 2Medium: 0% / 100% / 0% · n 8Reasoning disabled: 56% / 44% / 0% · n 16 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-22 | Partial 3/3All settings testedMany programs needed repair | DetailsCharts |
| 15 | Claude Sonnet 5 | Anthropic | 45.5 | Baseline | IntensiveBalancedBaseline | XHigh: 100% / 0% / 0% · n 8Medium: 100% / 0% / 0% · n 8Thinking disabled: 100% / 0% / 0% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-23 | All settings tested | DetailsCharts |
| 16 | GPT 5 | OpenAI | 44.5 | Baseline | IntensiveBalancedBaseline | High: 75% / 25% / 0% · n 8Medium: 75% / 13% / 12% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | Partial 2/3Missing Baseline | DetailsCharts |
| 17 | DeepSeek V4 Pro | DeepSeek | 43.5 | Baseline | IntensiveBalancedBaseline | XHigh: 13% / 62% / 25% · n 8Reasoning disabled: 50% / 38% / 12% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | Partial 2/3Missing BalancedMany programs needed repairMany programs failed | DetailsCharts |
| 18 | Kimi K2.7 Code | Moonshot | 42.4 | Baseline | IntensiveBalancedBaseline | Reasoning enabled: 0% / 75% / 25% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | Partial 1/3Intensive not supportedBaseline not supportedMany programs needed repairMany programs failed | DetailsCharts |
| 19 | Qwen3.7 Max | Alibaba | 42.4 | Baseline | IntensiveBalancedBaseline | Reasoning enabled: 13% / 75% / 12% · n 8Reasoning disabled: 88% / 0% / 12% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | Partial 2/3Intensive not supportedMany programs needed repair | DetailsCharts |
| 20 | GPT 4.1 | OpenAI | 41.5 | Baseline | IntensiveBalancedBaseline | None: 63% / 37% / 0% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | Partial 1/3Intensive not supportedBalanced not supported | DetailsCharts |
| 21 | MiMo-V2.5-Pro | Xiaomi | 41.1 | Baseline | IntensiveBalancedBaseline | Reasoning enabled: 0% / 75% / 25% · n 8Reasoning disabled: 57% / 29% / 14% · n 7 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | Partial 2/3Intensive not supportedMany programs needed repairMany programs failed | DetailsCharts |
| 22 | GPT 4.1 Nano | OpenAI | 39.7 | Baseline | IntensiveBalancedBaseline | Reasoning field omitted: 100% / 0% / 0% · n 1 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-14 | Partial 1/3Intensive not supportedBalanced not supported | DetailsCharts |
| 23 | Grok Build 0.1 | xAI | 39.5 | Baseline | IntensiveBalancedBaseline | Reasoning enabled: 0% / 100% / 0% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | Partial 1/3Intensive not supportedBaseline not supportedMany programs needed repair | DetailsCharts |
| 24 | Qwen3.8 Max | Alibaba | 39.1 | Baseline | IntensiveBalancedBaseline | XHigh: 80% / 0% / 20% · n 10Medium: 100% / 0% / 0% · n 8Minimal: 100% / 0% / 0% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-23 | Partial 3/3All settings tested | DetailsCharts |
| 25 | GPT-5.4 Mini | OpenAI | 38.7 | Baseline | IntensiveBalancedBaseline | Medium: 88% / 12% / 0% · n 8None: 75% / 25% / 0% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | Partial 2/3Missing Intensive | DetailsCharts |
| 26 | GPT-5.4 Nano | OpenAI | 37.9 | Baseline | IntensiveBalancedBaseline | Medium: 31% / 44% / 25% · n 16None: 31% / 44% / 25% · n 16 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | Partial 2/3Missing IntensiveMany programs failed | DetailsCharts |
| 27 | GPT-5.6 Luna | OpenAI | 37.8 | Baseline | IntensiveBalancedBaseline | XHigh: 100% / 0% / 0% · n 8Medium: 88% / 12% / 0% · n 8None: 100% / 0% / 0% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-23 | All settings tested | DetailsCharts |
| 28 | O3 | OpenAI | 37.5 | Baseline | IntensiveBalancedBaseline | High: 59% / 0% / 41% · n 32Medium: 75% / 0% / 25% · n 8Low: 50% / 0% / 50% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-23 | Partial 3/3All settings testedMany programs failed | DetailsCharts |
| 29 | Ox Alpha | Other | 36.3 | Baseline | IntensiveBalancedBaseline | Max: 88% / 12% / 0% · n 25High: 70% / 17% / 13% · n 30Low: 63% / 30% / 7% · n 30 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-23 | All settings tested | DetailsCharts |
| 30 | Hy3 Preview | Tencent | 36.1 | Baseline | IntensiveBalancedBaseline | High: 56% / 22% / 22% · n 9None: 50% / 25% / 25% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | Partial 2/3Missing BalancedMany programs failed | DetailsCharts |
| 31 | Gemma 4 31B | 34.6 | Baseline | IntensiveBalancedBaseline | Reasoning enabled: 0% / 57% / 43% · n 7Reasoning disabled: 72% / 14% / 14% · n 7 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | Partial 2/3Intensive not supportedMany programs needed repairMany programs failed | DetailsCharts | |
| 32 | Qwen3.7 Plus | Alibaba | 34.4 | Baseline | IntensiveBalancedBaseline | Reasoning enabled: 13% / 62% / 25% · n 8Reasoning disabled: 45% / 22% / 33% · n 9 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | Partial 2/3Intensive not supportedMany programs needed repairMany programs failed | DetailsCharts |
| 33 | Gemini 3.5 Flash Lite | 34.4 | Baseline | IntensiveBalancedBaseline | High: 81% / 6% / 13% · n 16Medium: 88% / 0% / 12% · n 16Minimal: 56% / 38% / 6% · n 16 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-23 | All settings tested | DetailsCharts | |
| 34 | DeepSeek V4 Flash | DeepSeek | 33.3 | Baseline | IntensiveBalancedBaseline | XHigh: 38% / 37% / 25% · n 8Medium: 63% / 25% / 12% · n 16Reasoning disabled: 63% / 25% / 12% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | Partial 3/3All settings testedMany programs failed | DetailsCharts |
| 35 | Laguna S 2.1 | Other | 33.2 | Baseline | IntensiveBalancedBaseline | Enabled: 50% / 29% / 21% · n 14None: 50% / 36% / 14% · n 14 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-23 | Partial 2/3Intensive not supported | DetailsCharts |
| 36 | Inkling Small | Other | 33.0 | Baseline | IntensiveBalancedBaseline | Max: 60% / 20% / 20% · n 10Medium: 45% / 44% / 11% · n 9None: 56% / 33% / 11% · n 9 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-23 | Partial 3/3All settings tested | DetailsCharts |
| 37 | Minimax M3 | MiniMax | 32.8 | Baseline | IntensiveBalancedBaseline | Reasoning enabled: 0% / 88% / 12% · n 8Reasoning disabled: 50% / 25% / 25% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | Partial 2/3Intensive not supportedMany programs needed repairMany programs failed | DetailsCharts |
| 38 | MiMo-V2.5 | Xiaomi | 32.7 | Baseline | IntensiveBalancedBaseline | High: 0% / 63% / 37% · n 8Reasoning enabled: 9% / 58% / 33% · n 12Reasoning disabled: 44% / 25% / 31% · n 16 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | Partial 3/3All settings testedMany programs needed repairMany programs failed | DetailsCharts |
| 39 | LongCat 2.0 | Other | 32.5 | Baseline | IntensiveBalancedBaseline | Enabled: 56% / 19% / 25% · n 16None: 50% / 38% / 12% · n 16 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-22 | Partial 2/3Intensive not supportedMany programs failed | DetailsCharts |
| 40 | Nemotron 3 Ultra 550B A55B | NVIDIA | 31.9 | Baseline | IntensiveBalancedBaseline | High: 12% / 44% / 44% · n 16Medium: 0% / 56% / 44% · n 9Reasoning disabled: 56% / 22% / 22% · n 9 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | Partial 3/3All settings testedMany programs needed repairMany programs failed | DetailsCharts |
| 41 | Step 3.7 Flash | StepFun | 30.8 | Baseline | IntensiveBalancedBaseline | High: 0% / 63% / 37% · n 8Medium: 0% / 50% / 50% · n 8Low: 38% / 12% / 50% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-19 | Partial 3/3All settings testedMany programs needed repairMany programs failed | DetailsCharts |
| 42 | Nex N2 Pro | Nex AGI | 29.6 | Baseline | IntensiveBalancedBaseline | Reasoning enabled: 0% / 63% / 37% · n 8Reasoning disabled: 0% / 44% / 56% · n 16 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | Partial 2/3Intensive not supportedMany programs needed repairMany programs failed | DetailsCharts |
| 43 | Inkling | Other | 28.7 | Baseline | IntensiveBalancedBaseline | Max: 25% / 31% / 44% · n 16Medium: 31% / 6% / 63% · n 16None: 44% / 31% / 25% · n 16 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-22 | Partial 3/3All settings testedMany programs failed | DetailsCharts |
| 44 | GPT-OSS 120B | OpenAI | 28.3 | Baseline | IntensiveBalancedBaseline | High: 0% / 63% / 37% · n 8Medium: 13% / 75% / 12% · n 8Low: 63% / 25% / 12% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-23 | All settings testedMany programs needed repairMany programs failed | DetailsCharts |
| 45 | North Mini Code | Other | 27.0 | Baseline | IntensiveBalancedBaseline | Enabled: 38% / 37% / 25% · n 8None: 19% / 12% / 69% · n 16 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | Partial 2/3Missing IntensiveMany programs failed | DetailsCharts |
| 46 | Gemini 3.1 Flash Lite | 25.5 | Baseline | IntensiveBalancedBaseline | High: 0% / 63% / 37% · n 8Medium: 25% / 50% / 25% · n 8Reasoning disabled: 38% / 25% / 37% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | Partial 3/3All settings testedMany programs needed repairMany programs failed | DetailsCharts | |
| 47 | Mistral Medium 3.5 | Mistral | 24.2 | Baseline | IntensiveBalancedBaseline | High: 22% / 22% / 56% · n 9None: 25% / 25% / 50% · n 8 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | Partial 2/3Balanced not supportedMany programs failed | DetailsCharts |
| 48 | Ling 3.0 Flash | InclusionAI | 23.7 | Baseline | IntensiveBalancedBaseline | Enabled: 7% / 33% / 60% · n 15None: 38% / 25% / 37% · n 16 | Combines this model's tested reasoning settingsUses the standard GameBench player-program prompt | 2026-08-05 | Partial 2/3Missing IntensiveMany programs failed | DetailsCharts |