Iemand legt een moderne woonkamer vast met de camera van een smartphone bij daglicht.
Nieuws2 september · 16:385 leestijd

World Labs brengt wereldmodel Atlas uit voor 3D-scenes uit een paar foto's

World Labs brengt Atlas uit, een wereldmodel dat uit een handvol foto's een 3D-ruimte reconstrueert en exporteert als Gaussian splat. Het model draait in early access; het publiek beschikbare Marble gaat er later op draaien.

World Labs brengt Atlas uit, een wereldmodel dat uit één tot enkele tientallen foto's een 3D-ruimte reconstrueert en die exporteert als puntenwolk of Gaussian splat. Het lab van Fei-Fei Li geeft voorlopig alleen geselecteerde partners toegang.

Voor wie in Nederland met fysieke ruimte werkt, een makelaar, een winkelinrichter, een opleider of een machinebouwer, verschuift daarmee vooral de drempel aan de invoerkant. Een bruikbare 3D-opname vroeg tot nu toe een laserscanner of een dichte reeks opnames. World Labs schrijft dat Atlas meestal al bij twee of drie beelden een getrouwe reconstructie geeft. Direct inzetten kan niet: Atlas draait in early access en er is geen prijs bekend. Wat er wel staat, is Marble, het bestaande product van hetzelfde lab dat Atlas straks gaat aandrijven.

Eén model voor genereren, reconstrueren en simuleren

Atlas is volgens de aankondiging van 1 september van de grond af voorgetraind als omni-model: een multimodale autoregressieve diffusietransformer die tekst, beelden, cameraposities en 3D-dieptekaarten native verwerkt. Alle invoer belandt in één gedeelde ruimtelijke context waarin elk beeld een vaste positie in de ruimte krijgt, en het model genereert vanuit die context wat daarop volgt. The Decoder omschrijft de opzet als een model dat de manier van genereren van een taalmodel combineert met de kwaliteit van diffusie.

Vier taken zitten in datzelfde model:

  • Camera-gestuurde generatie: uit één of meer referentiebeelden video van maximaal één minuut op 1440p, waarbij de camerabaan echte invoer is en geen tekstinstructie.
  • Ruimtelijke reconstructie: van één tot ruim honderd invoerbeelden, met als uitvoer zowel nieuwe beelden als expliciete 3D-geometrie in de vorm van puntenwolken of 3D Gaussian splats.
  • Ruimte-tijd-simulatie: bullet time uit drie tot vijf gewone telefooncamera's, en real-to-sim voor robotica, waarbij het model ook de beeld- en dieptedata genereert die de sensor van een gesimuleerde robot onderweg zou zien.
  • Beeldgeneratie: losse beelden en 360-panorama's uit een tekstprompt.
Uit één straatfoto van de Transamerica Pyramid genereert Atlas een luchtbeeld van de skyline van San Francisco. Het invoerbeeld staat linksonder als inzet. Bron: World Labs.
Uit één straatfoto van de Transamerica Pyramid genereert Atlas een luchtbeeld van de skyline van San Francisco. Het invoerbeeld staat linksonder als inzet. Bron: World Labs.

Wat het model niet doet, staat er zelf bij. Hoe meer beelden Atlas krijgt, hoe minder het verzint. Bij één foto vult het de rest van de scène in met wat plausibel is: in het voorbeeld hierboven bouwt het uit een straatfoto van de Transamerica Pyramid een compleet luchtbeeld van San Francisco, waarvan het grootste deel bedacht is. Voor een sfeerimpressie is dat bruikbaar. Voor maatvoering niet.

De cijfers komen van het lab zelf

Staafdiagram van World Labs met de gemiddelde 3D-reconstructiefout, lager is beter: Atlas 25,3, Pi3X 28,7, π³ 34,7, VGGT-Ω 1B 36,4, Depth Anything 3 39,3 en MapAnything 47,7. Bron: World Labs.
Staafdiagram van World Labs met de gemiddelde 3D-reconstructiefout, lager is beter: Atlas 25,3, Pi3X 28,7, π³ 34,7, VGGT-Ω 1B 36,4, Depth Anything 3 39,3 en MapAnything 47,7. Bron: World Labs.

Op reconstructie meet World Labs een gemiddelde fout van 25,3 tegen 28,7 voor Pi3X, 36,4 voor VGGT-Ω 1B en 47,7 voor MapAnything, allemaal modellen die alleen voor 3D-reconstructie zijn getraind. Bij camerabesturing kozen externe beoordelaars in blinde vergelijkingen Atlas boven MiniMax H3 in 75 procent van de gevallen, oplopend tot 94 procent tegen Seedance 2.5. In 93 procent van de vergelijkingen won Atlas van FLUX 3, het Duitse model dat beeld, video en robotaansturing in één architectuur leert en bij Audi flexibele deurrubbers plaatst.

Die opzet is niet neutraal, en het lab tekent dat zelf aan: de concurrenten kregen de camerabaan als tekstprompt, omdat ze camerageometrie niet als invoer accepteren. De vergelijking meet dus deels een architectuurvoordeel en niet alleen beeldkwaliteit.

Wat er vandaag wel te gebruiken is

Toegang tot Atlas loopt via een aanvraagformulier voor geselecteerde partners; een algemene release of een prijs is niet aangekondigd. Marble, het publiek beschikbare wereldmodel waar Atlas later onder komt te liggen, heeft die wel. Het gratis plan geeft 7.000 credits en maximaal vier gegenereerde werelden. Export van splat-bestanden begint bij Standard voor 20 dollar per maand, en commerciële rechten zitten pas vanaf het Pro-plan van 35 dollar per maand in het pakket. Dat laatste is het detail dat telt zodra een gegenereerde ruimte in een klantpresentatie of een verkoopbrochure belandt.

Waar het geld en de toepassingen heen wijzen

World Labs haalde in februari 1 miljard dollar op bij onder meer AMD, Autodesk, Nvidia en Fidelity. Autodesk op die lijst zegt iets over de richting: niet naar filters voor sociale media, maar naar bouw, ontwerp en fabricage. Visuele effecten, gameontwerp en het trainen van robots zijn de eerste plekken waar dit soort modellen landt, waarbij een ontwikkelaar een fysieke ruimte met een telefoon vastlegt en die als simulatie hergebruikt.

Dezelfde beweging is dichter bij huis zichtbaar. Het Nijmeegse lab van Pim de Witte traint wereldmodellen op gameplay met actielabels en onderhandelt over een ronde bij een pre-money waardering van 6 miljard dollar, met robots als bestemming van het geld.

Het patroon is telkens hetzelfde: het vastleggen van een ruimte raakt losgekoppeld van dure apparatuur. Wat overblijft is een telefoon, een handvol frames en een model dat de rest invult. Zolang dat invullen giswerk is, ligt de bruikbare toepassing bij een presentatie of een simulatie en niet bij een meting. De vraag verschuift daarmee van of je een ruimte kunt digitaliseren naar welk deel van wat je ziet echt gemeten is.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Ruimtelijke AI in je proces

Een model als dit levert pas iets op als het in je eigen werkstroom landt: waar de beelden binnenkomen, wie ze te zien krijgt en wat er daarna mee gebeurt. Ik denk met je mee over die vraag, ontwerp de flow en bouw hem af, van koppeling tot draaiend platform, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

Black Forest Labs brengt FLUX 3 uit voor beeld, video en robots
Nieuws
4 min

24 jul 02:22

Black Forest Labs brengt FLUX 3 uit voor beeld, video en robots

Black Forest Labs bracht FLUX 3 uit, één AI-model dat beeld, video met geluid en robotsturing gezamenlijk leert. Het draait al in tests op een lopende band van Audi en biedt de maakindustrie een niet-Amerikaans, niet-Chinees alternatief.

Meta geeft agentmodel Muse Glimmer vrij onder Apache 2.0
Nieuws
6 min

10 aug 14:09

Meta geeft agentmodel Muse Glimmer vrij onder Apache 2.0

Meta zet de gewichten van agentmodel Muse Glimmer onder Apache 2.0 op Hugging Face. Het model van 30 miljard parameters draait op één consumenten-GPU en keert de gesloten koers van juni om.

Anthropic bevestigt eigen chipteam voor Claude en werft siliciumingenieurs
Nieuws
4 min

5 aug 18:12

Anthropic bevestigt eigen chipteam voor Claude en werft siliciumingenieurs

Anthropic bevestigt dat het een eigen siliciumteam opbouwt om maatwerkchips voor Claude te ontwerpen, met vacatures tot 485.000 dollar. Chips van AWS, Google, Nvidia en AMD blijven volgens het bedrijf centraal staan.

Black Forest Labs stelt FLUX 3 Video algemeen beschikbaar vanaf 6 dollarcent per seconde
Nieuws
4 min

5 aug 16:22

Black Forest Labs stelt FLUX 3 Video algemeen beschikbaar vanaf 6 dollarcent per seconde

Black Forest Labs haalt FLUX 3 Video uit early access. Clips tot twintig seconden met lipsynchrone dialoog kosten vanaf 6 dollarcent per seconde, en het lab publiceert voor het eerst tarieven per resolutie.

Broadcom lanceert VMware Private AI Cloud met meer dan 150 modellen op eigen infrastructuur
Nieuws
6 min

31 aug 16:47

Broadcom lanceert VMware Private AI Cloud met meer dan 150 modellen op eigen infrastructuur

Broadcom bundelt AI-inferentie, agents en klassieke workloads op VMware Cloud Foundation en valideert vijf modellen voor eigen datacenters. AgentMinder is er nu, de AI Gateway en de agentbeveiliging volgen later.

Nvidia koopt Hugging Face voor 12,9 miljard dollar, meldt The Information
Nieuws
5 min

27 aug 04:09

Nvidia koopt Hugging Face voor 12,9 miljard dollar, meldt The Information

The Information meldt een akkoord van 12,9 miljard dollar, Business Insider spreekt nog van lopende gesprekken. Geen van beide bedrijven bevestigt iets. Voor teams die modellen en inferentie van de hub halen, telt de neutraliteit.