Atlas: Een wereldmodel voor ruimtelijke intelligentie

Introductie van Atlas, ons nieuwe omni-wereldmodel voor ruimtelijke intelligentie.

Wereldmodellen genereren, reconstrueren en simuleren elke mogelijke wereld. Ze begrijpen hoe werelden eruitzien, zich gedragen en evolueren, zodat we denkbeeldige werelden kunnen renderen voor creatieve gebruikers, de echte wereld met hoge getrouwheid kunnen simuleren en robots kunnen helpen bij het plannen van acties. Bij World Labs bouwen we deze algemene wereldmodellen in het streven naar ruimtelijke intelligentie.

Vandaag presenteren we Atlas, ons wereldmodel van de volgende generatie. Atlas is een omni-model dat we vanaf nul hebben getraind om native te werken met tekst, afbeeldingen, video en 3D. Het is een multimodale autoregressieve diffusietransformer: alle inputs worden gecombineerd in een gedeelde ruimtelijke context. Atlas gebruikt die context om te genereren wat er volgt, waarbij het consistent blijft in 3D met alles wat het heeft gezien en imagineert wat er buiten het zichtveld ligt.

Atlas is gebouwd om te schalen: de prestaties verbeteren naarmate de trainingsrekenkracht (compute) toeneemt, en we verwachten dat deze trend zich voortzet terwijl we blijven schalen.

Atlas kan een breed scala aan taken uitvoeren die variëren van wereldgeneratie tot reconstructie en simulatie:

  • Camera-gestuurde generatie: Atlas genereert afbeeldingen en video's vanuit één of meerdere afbeeldingen met pixel-perfecte camerabesturing, met een output van maximaal 1 minuut video in 1440p.
  • Ruimtelijke reconstructie: Atlas reconstrueert echte scènes vanuit één tot tientallen input-afbeeldingen. Het genereert zowel beeldframes vanuit nieuwe perspectieven als expliciete 3D-outputs, waarmee het state-of-the-art modellen die gespecialiseerd zijn in 3D-reconstructie overtreft.
  • Ruimte-tijdsimulatie: Atlas modelleert ruimte en tijd vanuit input-video's, waardoor video's kunnen worden geherkaderd (reframing) voor dramatische visuele effecten en Real-to-Sim-workflows voor robotica mogelijk worden.
  • Beeldgeneratie: Atlas genereert afbeeldingen en 360-panorama's vanuit tekst; het kan complexe prompts volgen, tekst renderen en een grote verscheidenheid aan visuele stijlen genereren.

Atlas zal de motor zijn voor toekomstige versies van Marble en andere producten van World Labs.

Camera-gestuurde generatie

Atlas neemt één of meer referentie-afbeeldingen en genereert nieuwe weergaven op elke door jou opgegeven camerapositie en -hoek. De gegenereerde weergaven komen overeen met de inhoud en geometrie van de input-afbeeldingen en extrapoleren vloeiend daarbuiten om delen van de scène te verbeelden die niet zichtbaar zijn in de inputs. Atlas gaat om met een breed scala aan scenetypes, visuele stijlen en camerabewegingen. Video's worden gegenereerd vanuit één tot zes input-afbeeldingen met handmatig ontworpen camerapadten.

Pixel-perfecte camerabesturing

Atlas gebruikt precieze camerageometrie als een native inputtype, wat verder gaat dan grove tekstgebaseerde instructies voor camerabesturing. Hierdoor kun je elk shot kadreren en elke beweging controleren.

In voorbeelden waarbij Atlas een volledige scène genereert vanuit een enkele input-afbeelding, gebruikt het de inhoud van de afbeelding samen met zijn brede wereldkennis om te bedenken hoe de scène er vanuit nieuwe hoeken uit zou moeten zien. Zo kan het de achterkant van een robot genereren of inschatten dat er een grasveld naast een zwembad moet liggen.

Genereren met ruimtelijke context

Net als een LLM codeert Atlas eerst zijn inputs in een context, om vervolgens outputs te genereren die zijn geconditioneerd op die context. Atlas is echter uniek omdat elke afbeelding is verankerd aan een 3D-positie in de ruimte; dit vormt een ruimtelijke context.

Het beheren van deze ruimtelijke context ontsluit geheel nieuwe vormen van creatieve controle. Men kan bijvoorbeeld twee niet-gerelateerde referentie-afbeeldingen in de context plaatsen en deze in de 3D-ruimte positioneren; Atlas genereert vervolgens een wereld die vloeiend tussen deze twee interpoleert. Hierbij imagineert het model overgangen zoals deuropeningen, gangen en nissen tussen voorheen niet-gerelateerde beeldparen.

Controleerbare lange video's

Door camerabewegingen te combineren met ruimtelijke contextbeheersing, maakt Atlas het mogelijk om lange video's met precieze controle te genereren. De gebruiker ontwerpt elke scène en elke camerahoek, waardoor men in de rol van regisseur stapt in plaats van blindelings op een resultaat te hopen. Zo kan er een video van 1 minuut in 1440p resolutie worden gegenereerd met een klein aantal referentie-afbeeldingen en een handmatig ontworpen camerapad.

Ruimtelijke reconstructie

Atlas reconstrueert echte ruimtes vanuit één of meer input-afbeeldingen. Er is geen speciale opnameapparatuur of honderden dichte weergaven nodig om objecten en scènes getrouw te reconstrueren. Dit is een belangrijke stap voorwaarts in het oplossen van het probleem van novel view synthesis vanuit schaarse input-afbeeldingen, een fundamenteel probleem in 3D-computervisie dat al decennia bestaat.

Reconstrueren vanuit meerdere afbeeldingen

Atlas kan een variabel aantal input-weergaven van een scène ontvangen. Wanneer delen van de wereld niet zichtbaar zijn, gebruikt Atlas zijn wereldkennis om de gaten op een plausibele manier op te vullen. Wanneer een exacte reconstructie van een echte locatie vereist is, kan men meer input-afbeeldingen toevoegen; hoe meer Atlas ziet, hoe minder het hoeft te imagineren.

Atlas levert doorgaans getrouwe reconstructies met slechts twee of drie afbeeldingen, waarmee het beter presteert dan gespecialiseerde modellen voor 3D-reconstructie. Echter, Atlas kan ook meer dan honderd input-afbeeldingen in zijn ruimtelijke context gebruiken voor een uiterst nauwkeurige weergave van echte omgevingen.

Het reconstrueren van diverse paden

Atlas kan veel verschillende trajecten door dezelfde scène genereren. Ongeacht hoe vaak het camerapad wordt gewijzigd, de scène blijft consistent. Verschillende camerapaden kunnen diverse delen van de scène benadrukken of de sfeer veranderen door te variëren in snelheid, lengte of complexiteit.

Expliciete 3D-outputs

Voor workflows in robotica, gaming, design en VFX zijn vaak expliciete 3D-outputs nodig. Atlas werkt native met zowel 2D-beeldframes als 3D-dieptekaarten, waardoor het werelden kan outputten als point clouds of 3D Gaussian splats.

  • Van één afbeelding: Atlas genereert nieuwe weergaven en 3D-geometrie, die vervolgens worden omgezet in 3D Gaussian splats.
  • Van video: Atlas voorspelt de diepte van elk frame en combineert deze tot een 3D-reconstructie.

Terwijl point clouds de geometrie van een scène schatten, maken 3D Gaussian splats deze bruikbaar. Atlas vult de resterende gaten op en transformeert de point cloud in een complete splat-scène die op het apparaat zelf kan worden gerenderd met een hoge resolutie en framerate.

Ruimte-tijdsimulatie

Atlas fungeert als een wereldsimulator. Het begrijpt zowel de ruimtelijke structuur van de wereld als de manier waarop de wereld in de loop van de tijd evolueert.

Video-reframing

Atlas transformeert een handvol gewone camera's in een "bullet time" multiview-opnamestudio. Met beelden van slechts drie camera's kan Atlas de tijd bevriezen en shots herkaderen, waardoor gebeurtenissen vanuit onmogelijke hoeken kunnen worden bekeken. Dit vereist geen professionele fotografen of gespecialiseerde apparatuur; het kan worden gedaan met gewone smartphones op statieven.

Roboticasimulatie

Atlas ontsluit nieuwe manieren om Real-to-Sim op te schalen voor zowel navigatie als manipulatie.

Voor robotica is reconstructie slechts de helft van het werk. Terwijl een gesimuleerde robot door de ruimte beweegt, genereert Atlas ook de RGB- en dieptegegevens die de sensoren van de robot onderweg zouden waarnemen. De wereld en het beeld van de robot komen uit hetzelfde model.

Bij robotmanipulatie gaat Atlas nog een stap verder: vanuit enkele informele opnames helpt Atlas bij het bouwen van een simulatie die ook vastlegt hoe objecten bewegen en interageren. Eenmaal gesimuleerd kan de taak eenvoudig worden gevarieerd door objecten, posities, bewegingen, verlichting en achtergronden aan te passen. Dit resulteert in diverse trainingsdata en testomgevingen voor robotica op grote schaal.

Beeldgeneratie

Hoewel de primaire focus van Atlas ligt op wereldmodellering, is het ook een capabele beeldgenerator. Het kan complexe prompts volgen, tekst renderen en diverse visuele stijlen genereren. Daarnaast genereert Atlas 360-graden afbeeldingen vanuit tekst- of beeldprompts.

Technische details

Modelarchitectuur

Atlas is een omni-model dat ontworpen is om veel taken en verschillende soorten input- en outputdata te verwerken in één uniforme architectuur, met ruimtelijke controle als kern. Dit vereist een afwijking van standaardarchitecturen van LLM's en videomodellen.

Atlas is een multimodale autoregressieve diffusietransformer. De inputs zijn verankerd in de 3D-ruimte om een ruimtelijke context te vormen, en het genereert multimodale outputs die geconditioneerd zijn op deze context.

De architecturale eigenschappen zijn als volgt:

  • Multimodaal: Atlas kan native verschillende datatypes verwerken, waaronder tekst, afbeeldingen, cameraposities en 3D-dieptekaarten. Video's worden weergegeven als sequenties van afbeeldingen.
  • Autoregressief: Atlas werkt met sequenties van elementen. Elk output-element wordt één voor één gegenereerd, geconditioneerd op eerdere delen van de sequentie.
  • Diffusie: Atlas is een rectified flow-model dat outputs genereert door ze geleidelijk te ontdruisden (denoising). Dit is ideaal voor hoog-dimensionale continue data zoals beelden en video.
  • Transformer: De transformer-architectuur is goed aangepast aan moderne hardware en dient als een robuuste ruggengraat voor wereldmodellering.

Atlas combineert innovaties uit LLM's (zoals KV-caching, cache-aware routing en disaggregated serving) met algoritmen uit moderne beeld- en videomodellen (zoals diffusion distillation, classifier-free guidance en geavanceerd VAE-ontwerp).

Benchmarks

Er is geen enkelvoudige benchmark die de generaliteit van Atlas volledig vangt, maar kwantitatieve evaluaties op twee kerngebieden tonen superieure prestaties ten opzichte van gespecialiseerde modellen:

1. Camera-gestuurde generatie In tests waarbij een enkele input-afbeelding werd gecombineerd met cinematografische camerabewegingen, kozen menselijke beoordelaars vaker voor Atlas dan voor andere topmodellen. Het voordeel van Atlas groeit naarmate de cameratrajecten complexer worden.

2. 3D-reconstructie Bij de taak van 3D-reconstructie vanuit schaarse input-weergaven presteert Atlas beter dan de beste gespecialiseerde open-source reconstructiemodellen. In evaluaties op diverse benchmarks (zoals DTU, ETH3D, KITTI, NRGBD, 7-Scenes en T&T) scoorde Atlas consistent een lagere (betere) Mean absolute-relative pointmap error.

Model Scaling

Het merendeel van de vooruitgang in moderne AI wordt gedreven door schaling. World Labs ziet sterk bewijs dat Atlas zal blijven verbeteren naarmate er meer data en rekenkracht worden ingezet. Tijdens de ontwikkeling bleek dat elk nieuw niveau van compute nieuwe modelcapaciteiten ontsloot.

***

Referentie:

@article{worldlabs2026atlas,
author = {World Labs Team},
title = {Atlas: A World Model for Spatial Intelligence},
journal = {World Labs Blog},
year = {2026},
note = {https://www.worldlabs.ai/blog/atlas},
}