NanoGPT Speedrun Frontier

Resultaten van de modellen

Hieronder volgt het overzicht van de best gevalideerde resultaten per model.

ModelHarnessRecordGat gedicht (%)@24HTotaal TokensOutput TokensExpsCallsDagen
Fable 5claude-code · high2.72681,7%3.010800M1,1M8113k8,7
Opus 5claude-code · max2.92053,6%3.045183M690k2924012,9
Kimi K3prime-agent · max2.93052,2%3.125112M2,2M483,6
Kimi K3kimi-code · max2.97445,8%3.135682M1,4M7134k5,1
Opus 4.8claude-code · max3.01839,4%3.180318M2,3M4272k3,0
GPT-5.6 Solcodex · xhigh3.04235,9%3.1602,9B2,2M96328k6,1
GPT-5.6 Sol Procodex · xhigh3.05833,6%3.1001,2B4,6M5097k3,4
Sonnet 5claude-code · max3.10526,8%3.120998M2,1M2132k2,0
GPT-5.6 Lunacodex · xhigh3.11026,1%3.170894M888k36212k1,9
Grok 4.5grok-cli · xhigh3.12024,6%3.16046M385k3994k2,7
Qwen3.8 Maxqwen-code · max3.12024,6%3.225216M629k3128661,9
GLM 5.2pi · high3.15020,3%3.20057M1,7M1941k1,8
DeepSeek V4 Proclaude-code · max3.20512,3%3.20526M319k1893091,1
GPT-5.6 Terracodex · xhigh3.21411,0%3.214417M298k1543k1,1
Grok 4.6grok-cli · xhigh3.22010,1%27M346k97690,6
Muse Spark 1.2muse-code · xhigh3.2308,7%41M910k56720,6
Muse Spark 1.1pi · max3.2328,4%3.240122M1,6M4892k3,7
GPT-5.5codex · xhigh3.2348,1%3.23470M77k1856141,1
Kimi K2.7kimi-code · max3.2407,2%3.240160M763k1873k1,6
GLM 5.3claude-code · xhigh

Vergelijking bij gelijk budget

Bij deze vergelijking krijgt de beste laatste run van elk model hetzelfde resourcebudget. Er wordt gekeken naar het beste gevalideerde record dat binnen dit budget is bereikt.

Budget: 24 uur

  • Menselijk record: 2.600
  • Baseline: 3.290

Resultaten per model:

  • Fable 5: 3.010
  • Opus 5: 3.045
  • GPT-5.6 Sol Pro: 3.100
  • Sonnet 5: 3.120
  • Kimi K3 · prime-agent: 3.125
  • Kimi K3: 3.135
  • GPT-5.6 Sol: 3.160
  • Grok 4.5: 3.160
  • GPT-5.6 Luna: 3.170
  • Opus 4.8: 3.180
  • GLM 5.2: 3.200
  • DeepSeek V4 Pro: 3.205
  • GPT-5.6 Terra: 3.214
  • Grok 4.6: 3.220
  • Qwen3.8 Max: 3.225
  • Muse Spark 1.2: 3.230
  • GPT-5.5: 3.234
  • Muse Spark 1.1: 3.240
  • Kimi K2.7: 3.240
  • GLM 5.3: —