Maan met gemarkeerde locaties voor ijs, vulkanische kenmerken en kraters
Nieuws10 september · 16:384 min leestijd

IBM en NASA maken open maanmodel en dataset openbaar

IBM en NASA maken een maanmodel en SomBench-dataset openbaar. De open gewichten, code en licenties maken hergebruik en zelf hosten mogelijk, terwijl benchmarks laten zien hoe één model verschillende wetenschappelijke taken met minder trainingsdata aanpakt.

Maanmodel: IBM en NASA maken een multimodaal AI-model en een machine-learningklare dataset openbaar voor onderzoek naar ijs, kraters en vulkanische sporen, meldt IBM.

Voor een Nederlands bedrijf zit de zakelijke betekenis niet in de maan, maar in de architectuur. De modelgewichten staan onder de Apache-2.0-licentie en SomBench is onder CC BY 4.0 beschikbaar. Daardoor ontstaat een route om een model aan te passen of zelf te draaien zonder elke toepassing aan een gesloten AI-API te koppelen. De rekening verschuift dan naar hosting, rekenkracht, datarechten en beheer.

Een maanbeeld met gemarkeerde plekken voor ijs, vulkanische kenmerken en kraters, NASA en IBM Research
Een maanbeeld met gemarkeerde plekken voor ijs, vulkanische kenmerken en kraters, NASA en IBM Research

Eén model voor meerdere soorten maan-data

NASA en IBM trainen het model op ongeveer 2 miljoen beeldtegels uit de Lunar Reconnaissance Orbiter, aangevuld met gegevens van onder meer GRAIL, Lunar Prospector en JAXA’s SELENE/Kaguya. De gegevens omvatten 11 modaliteiten op twee ruimtelijke schalen: ongeveer 1 meter en 100 meter per pixel. NASA stelt het model op Hugging Face en de volledige code op GitHub beschikbaar.

Die combinatie is het nieuws. Onderzoekers krijgen geen losse kaart of één taakmodel, maar een herbruikbare representatie die kan worden aangepast voor onder meer kraterdetectie, het in kaart brengen van jonge vulkanische kenmerken en het schatten van mogelijke ijslocaties bij de polen. SomBench brengt daarvoor meer dan 30 ruimtelijk uitgelijnde lagen uit negen instrumenten en vier missies samen.

De open dataset is tegelijk fors. De WAC-track bevat 963.609 tegels en ongeveer 38 terabyte aan data; de NAC-track bevat 1.000.113 tegels en ongeveer 1,4 terabyte. Voor een organisatie die een vergelijkbare basis wil hergebruiken, betekent publiek beschikbaar dus niet dat opslag, dataverplaatsing en rekenkracht verwaarloosbaar zijn.

De hergebruikroute is ook bewust licht gehouden. Bij het fine-tunen bleven 90 procent van de basisgewichten bevroren en gebruikten de onderzoekers LoRA-adapters. Dat maakt van één gedeelde basis geen eindproduct, maar wel een vertrekpunt waarop meerdere specifieke taken kunnen voortbouwen zonder telkens vanaf nul te trainen.

De cijfers achter de release

IBM en NASA rapporteren dat het model bij het schatten van mogelijke ijsgebieden de fout met maximaal 22 procent verlaagt tegenover SwinV2-B. Bij kraterdetectie op ongeveer 100 meter per pixel presteert het bijna 19 procent beter met de helft van de trainingsdata. Voor vulkanische kenmerken ligt de gerapporteerde verbetering op 3 procent; op meterschaal is de nauwkeurigheid vergelijkbaar met sterke bestaande modellen. De volledige benchmarkcijfers en de gebruikte vergelijkingen staan in de technische toelichting.

Twee maanbeelden met automatisch gemarkeerde kraters, waaronder een nieuwe inslagkrater, NASA en IBM Research
Twee maanbeelden met automatisch gemarkeerde kraters, waaronder een nieuwe inslagkrater, NASA en IBM Research

Open betekent hier ook eigen beheer

De release is geen kant-en-klaar product voor operationele beslissingen. De modelkaart zegt expliciet dat het model niet is gevalideerd voor bijvoorbeeld landingsplaatscertificering of gevarenvrijgave, en dat de ijsuitvoer een modelmatige kanskaart is, geen gemeten ijsvoorraad. Voor zakelijk gebruik blijft dus dezelfde grens gelden: een open model verlaagt de afhankelijkheid van een gesloten leverancier, maar neemt testen, beveiliging, monitoring, updates en licentiecontrole niet over.

De verschuiving is daarmee groter dan één maanrelease. Grote, versnipperde datasets kunnen voortaan het vertrekpunt zijn voor een gedeelde en aanpasbare modelbasis in plaats van voor een nieuwe gesloten API per vraagstuk. Openheid wordt pas bruikbaar wanneer ook de datarechten, infrastructuur en verantwoordelijkheid rond die basis helder zijn.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Van open model naar eigen systeem

Ik help je van meedenken en ontwerp tot realiseren en automatiseren, met self-hosted waar dat kan. Zo wordt een open model een beheersbare oplossing voor je eigen data en proces, niet alleen een download.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

IFM geeft zes AI-modellen vrij met trainingscode en pre-trainingsdata
Nieuws
5 min

3 sep 18:36

IFM geeft zes AI-modellen vrij met trainingscode en pre-trainingsdata

Het Abu Dhabi-instituut IFM geeft zes AI-modellen van 0,9 tot 375 miljard parameters vrij met trainingscode en pre-trainingscorpus. Op de modelkaarten wijkt de licentie op een punt af van het persbericht.

Google’s Gemma-modellen passeren een miljard downloads
Nieuws
5 min

21 aug 06:20

Google’s Gemma-modellen passeren een miljard downloads

Google telt een miljard downloads voor zijn open Gemma-modellen en ruim honderdduizend afgeleide varianten. Belangrijker dan het cijfer is de licentie: Gemma 4 staat onder een kale Apache 2.0-tekst.

IBM brengt Granite PatchTST-FM-r2 uit voor tijdreeksvoorspellingen
Nieuws
4 min

9 sep 20:42

IBM brengt Granite PatchTST-FM-r2 uit voor tijdreeksvoorspellingen

IBM maakt Granite PatchTST-FM-r2 beschikbaar als zelf te draaien model voor zero-shot forecasting. De commerciële licentie verlaagt een juridische drempel, terwijl infrastructuur, validatie en onderhoud bij de gebruiker blijven.

Google DeepMind draait WeatherNext 3 elk uur en houdt de gewichten dicht
Nieuws
6

5 sep 12:10

Google DeepMind draait WeatherNext 3 elk uur en houdt de gewichten dicht

Google DeepMind brengt WeatherNext 3 uit: elk uur een nieuwe wereldwijde verwachting op live satellietbeelden, tot op stationsniveau. De gewichten blijven deze keer dicht, je neemt de data af via Google Cloud na toelating.

Google brengt TimesFM-3 uit en sluit commercieel gebruik van de gewichten uit
Nieuws
5 min

1 sep 00:10

Google brengt TimesFM-3 uit en sluit commercieel gebruik van de gewichten uit

Googles nieuwe voorspelmodel TimesFM-3 staat bovenaan drie benchmarks, maar de licentie verbiedt productie en omzetgerelateerd gebruik. Zakelijk voorspellen kan alleen via versie 2.5 of de betaalde route in BigQuery.

Roblox geeft drie moderatiemodellen vrij die elk chatplatform zelf kan draaien
Nieuws
5 min

21 aug 14:26

Roblox geeft drie moderatiemodellen vrij die elk chatplatform zelf kan draaien

Roblox publiceert een PII-detector, een spraakclassifier en Sentinel onder Apache 2.0. Voor elk Nederlands platform met gebruikerschat liggen er nu productiemodellen die direct raken aan AVG- en DSA-verplichtingen, inclusief cijfers per taal.