NanoGPT Speedrun Frontier
Resultaten van de modellen
Hieronder volgt het overzicht van de best gevalideerde resultaten per model.
| Model | Harness | Record | Gat gedicht (%) | @24H | Totaal Tokens | Output Tokens | Exps | Calls | Dagen |
|---|---|---|---|---|---|---|---|---|---|
| Fable 5 | claude-code · high | 2.726 | 81,7% | 3.010 | 800M | 1,1M | 81 | 13k | 8,7 |
| Opus 5 | claude-code · max | 2.920 | 53,6% | 3.045 | 183M | 690k | 29 | 240 | 12,9 |
| Kimi K3 | prime-agent · max | 2.930 | 52,2% | 3.125 | 112M | 2,2M | — | 48 | 3,6 |
| Kimi K3 | kimi-code · max | 2.974 | 45,8% | 3.135 | 682M | 1,4M | 71 | 34k | 5,1 |
| Opus 4.8 | claude-code · max | 3.018 | 39,4% | 3.180 | 318M | 2,3M | 42 | 72k | 3,0 |
| GPT-5.6 Sol | codex · xhigh | 3.042 | 35,9% | 3.160 | 2,9B | 2,2M | 96 | 328k | 6,1 |
| GPT-5.6 Sol Pro | codex · xhigh | 3.058 | 33,6% | 3.100 | 1,2B | 4,6M | 50 | 97k | 3,4 |
| Sonnet 5 | claude-code · max | 3.105 | 26,8% | 3.120 | 998M | 2,1M | 21 | 32k | 2,0 |
| GPT-5.6 Luna | codex · xhigh | 3.110 | 26,1% | 3.170 | 894M | 888k | 36 | 212k | 1,9 |
| Grok 4.5 | grok-cli · xhigh | 3.120 | 24,6% | 3.160 | 46M | 385k | 39 | 94k | 2,7 |
| Qwen3.8 Max | qwen-code · max | 3.120 | 24,6% | 3.225 | 216M | 629k | 31 | 2866 | 1,9 |
| GLM 5.2 | pi · high | 3.150 | 20,3% | 3.200 | 57M | 1,7M | 19 | 41k | 1,8 |
| DeepSeek V4 Pro | claude-code · max | 3.205 | 12,3% | 3.205 | 26M | 319k | 18 | 9309 | 1,1 |
| GPT-5.6 Terra | codex · xhigh | 3.214 | 11,0% | 3.214 | 417M | 298k | 15 | 43k | 1,1 |
| Grok 4.6 | grok-cli · xhigh | 3.220 | 10,1% | — | 27M | 346k | 9 | 769 | 0,6 |
| Muse Spark 1.2 | muse-code · xhigh | 3.230 | 8,7% | — | 41M | 910k | 5 | 672 | 0,6 |
| Muse Spark 1.1 | pi · max | 3.232 | 8,4% | 3.240 | 122M | 1,6M | 48 | 92k | 3,7 |
| GPT-5.5 | codex · xhigh | 3.234 | 8,1% | 3.234 | 70M | 77k | 18 | 5614 | 1,1 |
| Kimi K2.7 | kimi-code · max | 3.240 | 7,2% | 3.240 | 160M | 763k | 18 | 73k | 1,6 |
| GLM 5.3 | claude-code · xhigh | — | — | — | — | — | — | — | — |
Vergelijking bij gelijk budget
Bij deze vergelijking krijgt de beste laatste run van elk model hetzelfde resourcebudget. Er wordt gekeken naar het beste gevalideerde record dat binnen dit budget is bereikt.
Budget: 24 uur
- Menselijk record: 2.600
- Baseline: 3.290
Resultaten per model:
- Fable 5: 3.010
- Opus 5: 3.045
- GPT-5.6 Sol Pro: 3.100
- Sonnet 5: 3.120
- Kimi K3 · prime-agent: 3.125
- Kimi K3: 3.135
- GPT-5.6 Sol: 3.160
- Grok 4.5: 3.160
- GPT-5.6 Luna: 3.170
- Opus 4.8: 3.180
- GLM 5.2: 3.200
- DeepSeek V4 Pro: 3.205
- GPT-5.6 Terra: 3.214
- Grok 4.6: 3.220
- Qwen3.8 Max: 3.225
- Muse Spark 1.2: 3.230
- GPT-5.5: 3.234
- Muse Spark 1.1: 3.240
- Kimi K2.7: 3.240
- GLM 5.3: —
Groetjes,