InferQuest: Word een Inference- of Training Engineer

Kerncijfers van het programma

  • 2 paden met één gedeelde basis
  • 182 taken verdeeld over 38 quests
  • 21.740 XP om het laatste niveau te bereiken
  • 35 automatisch geverifieerde mijlpalen

Wat is InferQuest?

InferQuest is een gratis, open en non-commerciële webapplicatie voor het leren van inference engineering en LLM-training. Het programma is georganiseerd in quests en taken en biedt twee specifieke paden:

  1. Het snel en goedkoop serveren van grote taalmodellen.
  2. Het trainen van modellen met een zo hoog mogelijke kwaliteit op minimale hardware.

De voortgang wordt bijgehouden via XP, levels en streaks. Gebruikers worden getraind met gecertificeerde quizzen en spaced-repetition reviews. Belangrijke mijlpalen — zoals het implementeren van endpoints, GPU-kernels, trainingsruns en het mergen van open-source pull requests — worden automatisch geverifieerd.

Verificatie: Meer dan alleen checklists

In tegenstelling tot traditionele cursussen gebruikt InferQuest actieve verificatie:

  • Live endpoint probes: Wanneer je een OpenAI-compatibel endpoint implementeert (eerst met je eigen engine, daarna met productie-vLLM), test InferQuest dit in real-time op zaken als streaming framing, verbruiksadministratie, max_tokens cut-offs, foutvormen en latentiedoelen.
  • GPU-gegradeerde kernels & trainingsruns: Een lokale harness beoordeelt je kernels (waaronder attention, KV-cache, Triton softmax, flash attention, quantizer en ring all-reduce) en je trainingsruns. Er wordt gekeken naar eerste convergentie, een gemeten snelheidswinst van $\ge 1,5\times$ en een adapter-finetune waarbij het model geen kennis mag verliezen, alles binnen vaste token-budgetten op je eigen hardware.
  • Merged-PR checks: Open-source mijlpalen worden via de GitHub API gecontroleerd. Er wordt geverifieerd of je pull requests naar projecten zoals vLLM, SGLang, FlashInfer, TRL, torchtitan en nanochat daadwerkelijk bestaan, zijn gemerged en geen eenvoudige typo-fixes zijn.
  • Gegradueerde interview-oefeningen: Oefeningen over KV-cache sizing math, rooflines, speculative-decoding acceptance, scaling-laws, datacuratie en parallellisme-trade-offs worden server-side beoordeeld; de antwoorden worden nooit naar de browser gestuurd.

Curriculum: Eén basis, twee paden

Iedereen begint met de 'Foundations' (transformer-internals, GPU-architectuur, kernels) voordat men een specialisatie kiest. De titels Inference Engineer en Training Engineer worden verdiend als certificaten.

1. Foundations (Basis voor beide paden)

  • Bedrock: Mentale modellen
  • Transformer Internals: Fundamenten
  • GPU Architecture & CUDA: De hardware (The Metal)
  • Kernel Engineering: Kernelcraft
  • Quantization Theory: Precisie
  • Parallelism: Werken met meerdere GPU's

2. Inference Engineering

  • The Inference Engine: Engine Core
  • Quantization: Compressie
  • Production Serving: Productie
  • Distributed Inference: Datacenter-schaal
  • Observability & Economics: SLO's & Kosten
  • The Arena: Bewijs van werk (Proof of Work)

3. Model Training

  • Learning to Learn: Optimalisatie
  • The Speedrun: Efficiëntie
  • Post-Training: SFT & RL
  • Proof: Evaluaties
  • The Open Ladder: Bewijsvoering (Receipts)

Veelgestelde vragen

Wat doet een inference engineer? Een inference engineer zorgt ervoor dat grote taalmodellen snel en goedkoop geserveerd kunnen worden in productie. Dit omvat het schrijven en tunen van GPU-kernels, het beheren van KV-cache geheugen, het batchen van requests, het kwantiseren van gewichten en het beheren van engines zoals vLLM, SGLang en TensorRT-LLM om aan latentie- en kostendoelen te voldoen. Het is een van de snelst groeiende specialistische rollen in AI-infrastructuur.

Welke vaardigheden heb ik nodig om een inference engineer te worden? De kernvaardigheden zijn: transformer internals (attention, KV caching, sampling), GPU-architectuur en het schrijven van CUDA- of Triton-kernels, kwantisatie, continuous batching en paged attention, distributed serving (tensor- en pipeline-parallellisme) en profiling met tools zoals Nsight. De roadmap van InferQuest behandelt al deze onderdelen in de juiste volgorde.

Kan InferQuest me leren om mijn eigen LLM te trainen? Ja. Het pad Model Training behandelt dit volledig: backprop en optimizers vanaf nul, datacuratie met echte Common Crawl-pipelines, scaling-laws wiskunde, de NanoGPT-speedrun efficiency toolkit (Muon, FP8, fused kernels), en een pretraining-project in de klasse van GPT-2 dat kan draaien op één consumenten-GPU of voor ongeveer \$50 aan gehuurde compute. Daarnaast worden SFT, LoRA, DPO en GRPO post-training behandeld op een enkele GPU. Dit bereidt je voor op rollen in pretraining, post-training en RL-engineering.

Is InferQuest gratis? Krijg ik een certificaat? InferQuest is volledig gratis en open. Er is geen papieren certificaat. In plaats daarvan worden mijlpalen automatisch geverifieerd via live probes, GPU-gegradeerde kernel-submissions en merged-PR checks. Het resultaat is een portfolio van bewijzen (receipts), wat door hiring teams zwaarder weegt dan een certificaat.

Hoe lang duurt de roadmap? Beide paden samen beslaan 182 taken over 38 quests. Een ervaren software engineer die parttime studeert, kan ongeveer zes maanden tot een jaar rekenen voor één volledig pad — minder indien PyTorch en CUDA al bekend zijn.

Heb ik mijn eigen GPU nodig? Voor de fasen van kernel-engineering wel; de grading harness draait op je eigen hardware en elke moderne NVIDIA GPU is geschikt. Alles daarvoor (transformer internals, de inference-engine capstone, quizzen en oefeningen) draait op een CPU of in gratis cloud-notebooks.

***

De markt betaalt voor bewijs, niet voor beloftes. Elke geverifieerde mijlpaal laat een bewijsstuk achter: probe-resultaten, harness-metrieken met de naam van je GPU, en bewijs van gemergde PR's. Dat is een portfolio, geen certificaat.