>10x Efficiëntere Pretraining

Frontier pretraining wordt vaak gezien als een spel dat alleen voor grote labs is weggelegd. Omdat wij nog geen 100.000 chips hebben, was er voor ons maar één weg: algoritmische efficiëntie. Na een periode van continue verbetering is ons pretraining-recept nu meer dan 10 keer efficiënter in rekenkracht (compute) dan die van de leidende open-weight basismodellen.

We evenaren DeepSeek V4 Pro Base met ongeveer 50x minder FLOPs – dat is ongeveer de helft van de pretraining-compute van GPT-3, of circa $0,5 miljoen op GB200. We zijn doorgegaan met schalen met een factor 10 (~$4 miljoen) en presteerden significant beter dan alle publiekelijk beschikbare open basismodellen op perplexity-evaluaties. Volgens de schalingswetten in Figuur 1 zou het trainen van een model met dit niveau van bekwaamheid meer dan $100 miljoen kosten onder het recept van DeepSeek V4 Pro (en dit nog zonder rekening te houden met de beschikbaarheid van data). Uiteraard zullen we niet stoppen met schalen.

Wij geloven dat pretraining, agentic RL (Reinforcement Learning) en long-context voldoende zijn om supermenselijke codeer-agents te bouwen en AI-onderzoek en ontwikkeling (R&D) te automatiseren. We zijn begonnen met long-context; dit blogbericht gaat over pretraining.

Metriek en Vergelijking

We hebben het verlies in bits per byte gemeten (een metriek die verschillen in tokenizers neutraliseert) op geisoleerde (heldout) data en een schalingswet toegepast om te projecteren hoeveel rekenkracht nodig is om een bepaald niveau van bekwaamheid te bereiken. Een betere efficiëntie in training-compute betekent sterkere modellen bij alle budgetten.

We hebben de nieuwste beschikbare open-weight basismodellen van DeepSeek, Moonshot (Kimi) en NVIDIA geëvalueerd. Basismodellen voor Claude, Gemini, GPT-n en vele anderen zijn niet openbaar beschikbaar, maar Kimi K3 en Meta’s Muse Spark duiden respectievelijk op een winst van 2,5x en 3,3x ten opzichte van Kimi K2.

We hebben de logprobs voor open modellen geëvalueerd in zowel vLLM als SGLang op zowel GB200 als GB300, waarbij we tijdens het proces problemen ontdekten met sommige back-ends. Ter verdere bevestiging hebben we samengewerkt met Fireworks om de baseline logprobs te verifiëren in hun eigen inference-engine. Omdat modellen de kenmerken van hun trainingsparser kunnen leren, hebben we onze evaluatiesets gebouwd met een andere parser/OCR dan die in onze pretraining-pipeline wordt gebruikt.

Evaluatie van Generalisatie

Om generalisatie te meten, hebben we het verlies geëvalueerd op geisoleerde data (Figuur 1). Onze code-evaluaties bestaan uit onze eigen codebase en private codebases die we hebben verkregen van andere startups. Voor redenering-evaluaties hebben we Chain-of-Thought (CoT) en stap-voor-stap uitleggingen gegenereerd voor geisoleerde, private wiskundeproblemen met behulp van Kimi K3, waarbij we hebben gefilterd op correcte antwoorden. Voor tekst en onderzoek hebben we recente researchpapers met weinig citaties gebruikt. We hebben externe OSS-code verwijderd en elk document dat een overeenkomstige window van 96 normalized text-tekens had, of een Jaccard-similariteit boven een gevoelige drempelwaarde ten opzichte van onze trainingsdata.

Evaluatie van Kennis

Naast generalisatie zijn we geïnteresseerd in het testen van de kennis van ons model in cruciale domeinen om hiaten in onze dataset te identificeren. We kunnen bijvoorbeeld onze evaluatieset voor onderzoeksteksten opsplitsen per onderwerp.

Door granulaire categorieën van content te verzamelen (bijv. documentatie van een specifieke softwaretool of belangrijke papers in alignment-onderzoek), kunnen we nog preciezere signalen krijgen. In tegenstelling tot onze generalisatie-evaluatie, willen we deze informatie niet volledig uit het pretraining-corpus verwijderen, maar we moeten voorkomen dat het model sequenties simpelweg uit het hoofd leert (memorisatie). Om dit te doen, hebben we deze documenten herformuleerd of samengevat met behulp van een third-party frontier LLM. Om overfitting op granulaire evaluaties te voorkomen, hebben we deze één keer per modelgeneratie gemaakt en geëvalueerd; de onderstaande resultaten zijn van vorige week.

Het doel van Magic is om het beste model te bouwen voor programmeren en autonome AI R&D. Om de trade-offs in datamenging bewust in balans te brengen, evalueren we ook domeinen die we deprioriteren (bijv. feiten over bekende personen, lokaal nieuws of sport/evenementen).

Geen Snelkoppelingen

Eind 2024 trainden we een klein dens model met een architectuur die is ontworpen voor zeer grote context-windows. Onze initiële pretraining scale-ups liepen op diverse manieren mis. We leerden snel dat we eerst een stabiele fundering moesten bouwen: soepele convergentie, low-precision trainingkwaliteit equivalent aan FP32, een snelle en stabiele infrastructuur en correcte regels voor hyperparameter-schaling. En het belangrijkste: het opsporen van bugs.

Zodra dat geregeld was, moesten we genoeg verbeteringen in rekenefficiëntie vinden om de kloof met de frontier-modellen te dichten met minder compute. We begonnen met een paar grote weddenschappen, maar onze vooruitgang bleek het multiplicatieve resultaat te zijn van tientallen wijzigingen in modelarchitectuur, optimizer, trainingsdoelstelling en datacuratie.

NanoGPT-speedruns zorgen voor een snelle feedbackcyclus om nieuwe ideeën te evalueren, maar we ontdekten dat veel zaken die kleine modellen verbeteren, geen effect hebben op grote modellen. Omgekeerd zagen we dat sommige functies die in de meeste LLM's aanwezig zijn, verwijderd kunnen worden zonder de prestaties op grote schaal aan te tasten.

Om elke wijziging in model, optimizer of data te evalueren, trainen we drie modellen over twee grootteordes van rekenkracht. We beschouwen een wijziging als waardevol als de power-law fit suggereert dat het op schaal zal helpen. Elke paar weken schalen we op naar 1/10e van onze maximale schaal en elke paar maanden voeren we een volledige hero-run uit (V3, V4, V5 in Figuur 4).

Om te controleren hoe pretraining-verlies zich vertaalt naar prestaties na RL, hebben we een korte math RL-run uitgevoerd met een 16k CoT-budget (Figuur 5). Al onze RL-processen starten direct vanaf het basismodel, zonder SFT (Supervised Fine-Tuning) of distillatie.

Wat volgt er nu?

Ons werk aan pretraining en long-context is inmiddels behoorlijk volwassen. We gaan nu over naar het schalen van long-horizon RL, waarbij we agents trainen om te blijven leren na implementatie via long-context. Daarnaast besteden we aanzienlijke inspanningen aan alignment-trainingstechnieken met robuuste theoretische eigenschappen. En tot slot kijken we ernaar uit om het resultaat te publiceren!

Concrete problemen waar we ons op richten zijn:

  • Exploratie en credit assignment in long-horizon RL (en het systeemwerk om dit op te schalen).
  • Alignment-training tegenover nauwkeurig opgeroepen latente kennis.
  • Verdere verbeteringen aan pretraining.

We zijn waarschijnlijk het kleinste team ter wereld dat modellen met biljoenen parameters traint. De impact die één persoon met een sterk oordeelsvermogen kan hebben, is nog nooit zo groot geweest. Als je wilt helpen bij het bouwen van aligned superintelligence, overweeg dan ons team te joinen.

***

Voetnoten

  1. We rapporteren 6·N·D in plaats van exacte training FLOPs, waarbij N het aantal actieve parameters is en D het aantal pretraining-tokens. De kosten voor sequentie-dimensies (zoals attention) vormen een minderheid van de FLOPs, maar zijn afhankelijk van de exacte sequentie-lengte distributie. Omdat deze niet voor alle publieke modellen worden gerapporteerd, kozen we voor de 6·N·D benadering. De "6" komt voort uit (add+mul) (fwd+bwd2). We hebben de actieve parametercounts afgeleid door de safetensors headers van HuggingFace te downloaden, de vorm van elke tensor te lezen en de groottes van alle actieve parameters op te tellen, exclusief token embeddings en MTP heads.

Overzicht 6·N·D per model:

ModelND6·N·D
Current_e24 (ons)----1.63e24
Current_e23 (ons)----1.58e23
Current_e22 (ons)----1.12e22
V4 (ons)----1.91e24
V3 (ons)----3.85e24
V2 (ons)----7.20e23
DeepSeek V4 Pro48,852,265,05433T9.67e24
DeepSeek V4 Flash13,270,025,81032T2.55e24
Kimi K231,687,072,76815.5T2.95e24
Nemotron 3 Ultra54,985,076,73620T6.60e24

Bronnen: Kimi K2: 31.6B params, 15.5T tokens (tech report, Sectie 2.5). DeepSeek V4 Flash: 13.2B params, 32T tokens (tech report, Sectie 4.2.2) en DeepSeek V4 Pro: 48.8B params, 33T tokens (Sectie 4.2.2). Nemotron 3 Ultra: 55B params, 20T tokens (tech report, abstract).

  1. "Basismodellen" zijn pretrained modellen die nog geen reinforcement learning, SFT of andere post-training hebben ondergaan. Ze zijn zeer gevoelig voor prompting, wat sampling-based evaluaties onbetrouwbaar maakt. In plaats daarvan hebben we het bits-per-byte verlies gemeten op geisoleerde data. Opmerkelijk is dat Nemotron 3 over de hele linie beter presteert dan DeepSeek V4 Pro; dit suggereert dat de zwakkere benchmarkprestaties van Nemotron na RL mogelijk te wijten zijn aan zwakkere post-training, terwijl de pretrain juist voorliep op de Chinese open-weight concurrenten.
  1. We kunnen evaluaties alleen deconamineren voor onze eigen modellen, niet voor open-weight modellen. Dit betekent dat sommige data in onze internet-gebaseerde evaluaties mogelijk in hun trainingsdata zitten, wat in het voordeel van de open modellen zou werken.
  1. Er zijn uitschieters waarbij we vermoeden dat bron-memorisatie de resultaten vervormt. Zo heeft Nemotron specifieke getallen en zinnen uit medische/gezondheidsdocumenten gememoriseerd en voorspelt deze verbazingwekkend goed, zelfs na herformulering door een LLM. We hebben deze uitschieters toch in de plot opgenomen.
  1. We hebben de pass rate geëvalueerd op een private geisoleerde wedstrijd-wiskunde-evaluatie (400 problemen) die moeilijker is dan AIME. De e24-model's AIME26 pass@1 oversteeg 90% (en 100% pass@16) bij ongeveer 0,2% van zijn pretraining-compute budget, met gemiddeld iets meer dan 6k CoT-tokens.
  1. We zijn van plan een bijgewerkt AGI Readiness Policy te publiceren, inclusief deployment gates, veiligheidseisen tijdens RL-training en onze aanpak van alignment-onderzoek.