Nee, lokale modellen zullen niet winnen

Lokale modellen zijn te zwak voor breed gebruik

Lokale modellen zullen nooit zo krachtig worden. Ik denk dat dit punt overduidelijk zou moeten zijn: alle huidige frontier-modellen (zowel gesloten als open-weight) zijn veel te groot om op iets anders dan een volledig GPU-cluster in een datacenter te draaien. Natuurlijk worden kleinere modellen na verloop van tijd intelligenter. Over een jaar kun je misschien iets draaien op je laptop dat ongeveer zo sterk is als GPT-5.6-Sol. Maar tegen die tijd zul je GPT-5.6-Sol waarschijnlijk als te zwak beschouwen om nuttig te zijn.

Veel mensen ontkennen dit laatste punt, maar het is waar: de voorkeur van bijna iedereen is om het sterkste beschikbare model binnen hun prijsklasse te gebruiken. Als de vooruitgang van AI was gestagneerd bij GPT-4, denk ik dat we er zeer krachtige tools omheen hadden kunnen bouwen, maar wie zou GPT-4 vandaag de dag nog gebruiken? Naarmate LLM's capabeler zijn geworden, zijn onze verwachtingen gegroeid: we verwachten nu dat agentische systemen steeds meer problemen zelfstandig kunnen oplossen. Het is intens frustrerend wanneer ze in de war raken of vastlopen. Wanneer men de keuze heeft, zullen mensen kiezen voor het model dat hen minder frustreert, en dat zal altijd het grotere, krachtigere model zijn.

Lokale modellen zijn duurder en minder efficiënt

Daarnaast zullen datacenter-modellen altijd goedkoper zijn. Ik begrijp niet waarom mensen blijven zeggen dat lokale modellen goedkoop zijn; het lijkt me dezelfde fout die mensen maken wanneer ze zeggen dat Uber-chauffeur zijn "gratis geld" is (terwijl ze de kosten voor brandstof en slijtage van de auto negeren). Alleen al met de aanschafprijs van een eenvoudig home lab[^1] zou je meerdere jaren aan betaalde abonnementen bij een AI-provider kunnen kopen. De energiekosten zouden uitkomen op ongeveer $50 tot $300 per maand, afhankelijk van hoeveel inferentie je uitvoert: opnieuw, de prijs van enkele extra betaalde abonnementen.

Waarom zijn datacenter-modellen goedkoper? Dat is niet omdat datacenter-inferentie gesubsidieerd wordt; inferentie is eigenlijk vrij goedkoop. Als je hetzelfde model lokaal en in een datacenter draait, zal het datacenter-model inherent efficiënter zijn.

De belangrijkste reden is batching. Een GPU kan honderdduizenden wiskundige bewerkingen precies zo snel uitvoeren als één bewerking. Echter, bij de inferentie voor een enkele gebruiker is elk nieuw token afhankelijk van het resultaat van het vorige, waardoor het niet gebatched kan worden[^2]. Wat wél gebatched kan worden, is de inferentie van honderden gebruikers tegelijk. Dit kost in essentie net zoveel tijd, stroom en hitte als het uitvoeren van inferentie voor één gebruiker per keer.

Wanneer je je eigen inferentie thuis draait, heb je niets om te batchen — in het beste geval draai je een paar parallelle AI-agents — waardoor de benutting verschrikkelijk is. Er is veel potentiële rekenkracht waar je voor betaalt maar die je niet kunt gebruiken: het wordt simpelweg verspild. De enige manier om dit te omzeilen is door samen te werken met vrienden en jouw lokale inferentie-endpoint aan hen open te stellen (op welk punt je in feite je eigen gebrekkige datacenter runt).

De andere reden is dat datacenters grotere, efficiëntere GPU's gebruiken. De consumenten-GPU's die je voor lokale modellen zou gebruiken zijn gaming-GPU's zoals de RTX 4090. Een datacenter B200, ontworpen voor gebatchte AI-inferentie, haalt ongeveer drie keer zoveel flops en net onder vier keer de geheugenbandbreedte voor dezelfde hoeveelheid stroom[^3]. Dus, tussen batching en GPU-efficiëntie in, gebruik je ongeveer 30x zoveel resources om je model lokaal te draaien.

Overigens is dit waarom ik wantrouwig ben tegenover mensen die zeggen dat lokale modellen goed zijn omdat ze niet zo resource-intensief zijn als die "slechte" grote datacenters. Als je LLM's efficiënt wilt draaien, zou je juist zoveel mogelijk van je gebruik naar AI-datacenters moeten verschuiven! In de meest genereuze interpretatie bedoelen zij dat we allemaal kleinere modellen zouden moeten gebruiken — maar zelfs dan kun je kleine modellen idealiter het beste gebruiken via bijvoorbeeld de GPT-5.6 Luna API, in plaats van je eigen model te hosten.

Hoe zouden lokale modellen toch kunnen winnen?

Is er een mogelijke wereld waarin lokale modellen winnen? Ik veronderstel van wel. Eén scenario is dat overheden het gebruik van AI-datacenters volledig verbieden: ofwel vanwege zorgen over de gevaren van AI, of simpelweg door te buigen voor publieke druk. In die wereld zouden lokale modellen de enige optie zijn.

Alternatief zou de vooruitgang van AI op een bepaalde manier kunnen stagneren voor zeer grote modellen, terwijl deze wel doorgaat voor kleine modellen. Ik vind het moeilijk me voorstellen hoe dit zou kunnen gebeuren (behalve bij overheidsinterventie, zoals hierboven genoemd), maar in een wereld waar een model van 30B parameters een frontier-model is, zouden lokale modellen competitief kunnen zijn.

Of misschien worden modellen zo goed dat een 30B model echt slim genoeg is om alles te doen, waardoor niemand echt een model als Opus of Sol nodig heeft, tenzij ze de Riemann-hypothese proberen op te lossen. Ik geloof hier niet echt in. Modellen kunnen tegenwoordig grensverleggend wiskundig werk verrichten, terwijl ze nog steeds niet slim genoeg zijn om grote codebases net zo goed te refactoren als ik; het is dus moeilijk voor me om me een wereld voor te stellen waarin ik niet gewoon het slimste beschikbare model wil gebruiken.

Lokale modellen zijn niet nutteloos

Ik denk dat er altijd een niche zal zijn voor lokale modellen. Ik word herinnerd aan het verrassend eenvoudige idee achter de "Interaction Models" van Thinking Machines (wat OpenAI ook doet, omdat het logisch is): voor toepassingen waarbij latentie cruciaal is, zoals voice-chat, laat je een klein, snel model het praten afhandelen, dat vervolgens taken delegeert aan een groot, trager model voor het zware denkwerk. Ik zou niet verbaasd zijn als het meeste AI-gebruik over vijf jaar wordt gemedieerd via een lokaal model op je telefoon of laptop (hoewel in die wereld bijna al het werk nog steeds door AI-datacenters zou worden gedaan).

Sommige gebruikers zullen de voorkeur geven aan lokale modellen, ook al zijn ze zwakker en duurder. Zo kan het vermogen om het model lokaal te sturen een doorslaggevende functie zijn voor die gebruikers. Anderen hechten simpelweg waarde aan totale controle over hun eigen infrastructuur, of hebben onbetrouwbaar internet[^4]. Als je tot dat type mensen behoort — vooral als je alleen met de modellen chat in plaats van ze te gebruiken voor onderzoek of programmeren — dan zijn lokale modellen een goede keuze voor jou. Ik denk echter dat dit altijd een nichegroep zal blijven. De meerderheid van de gebruikers zal hun inferentie via datacenters blijven doen.

***

[^1]: Deze link is van een jaar geleden — zaken zijn nu aanzienlijk duurder. [^2]: Specifiek is de bottleneck het verplaatsen van de modelgewichten naar de GPU, wat moet gebeuren en precies dezelfde tijd in beslag neemt of je dit nu doet voor één token van één gebruiker of voor honderd tokens van honderd gebruikers. [^3]: Ik heb dit geschat met hulp van een LLM, maar je kunt de cijfers zelf controleren bij NVIDIA. [^4]: Terwijl men nog steeds beschikt over een betrouwbare stroomvoorziening en genoeg geld heeft om een home-inference cluster in te richten.