Close-up van een laptoptoetsenbord met blauwe lichtreflecties
Nieuws17 september · 20:333 min leestijd

Base Labs bouwt veiligheidsinfrastructuur voor open-weightmodellen

Base Labs, Hugging Face en Goodfire werken aan open veiligheidsinfrastructuur voor modeltraining en runtime-monitoring. De methoden zijn nog niet vrijgegeven, maar self-hosted modellen moeten tijdens gebruik controleerbaar blijven.

Base Labs kondigt samen met Hugging Face en Goodfire een open veiligheidsinfrastructuur aan voor training, evaluatie en runtime-monitoring van open-weightmodellen die bedrijven zelf draaien, meldt TechCrunch.

Voor een organisatie die een model zelf host, verschuift de veiligheidsgrens daarmee van alleen het model naar de hele keten: beleid tijdens training, signalen tijdens gebruik en controle vóór een actie. Dat maakt self-hosting niet automatisch veilig, maar het geeft wel een concreet ontwerp voor controleerbaarheid in productie.

De methode is nog niet vrijgegeven

De aankondiging beschrijft de richting, niet een product dat je vandaag kunt installeren. Base Labs wil methoden voor training en monitoring ontwikkelen en publiceren. Baseten wil die uitkomsten rechtstreeks in zijn infrastructuur voor modeluitvoering integreren en als beheerde dienst beschikbaar maken.

De partners noemen nog geen eerste repository, releasedatum, modeldekking of meetresultaten. Voor Nederlandse teams die hun modellen zelf draaien betekent dat: de stap is aangekondigd, maar er is nog geen nieuwe veiligheidslaag om vandaag op te baseren.

De aanleiding is concreet. Hugging Face toont volgens TechCrunch meer dan 6.000 modellen waarbij veiligheidsremmen via abliteration zijn verwijderd. Een model kan na zo’n wijziging anders reageren dan tijdens de oorspronkelijke evaluatie. Controle moet daarom doorlopen tot in de omgeving die het model uitvoert.

Drie lagen in de beoogde stack

De officiële toelichting werkt de aanpak uit als een lus die gedrag meet, afwijkingen vindt en de uitkomst terugbrengt naar training of beheersing:

  • Training: modellen leren expliciete beleidsregels volgen, hun grenzen herkennen en om hulp vragen als een taak niet legitiem kan worden uitgevoerd.
  • Monitoring en interventie: inputs, outputs, toolgebruik en interne modeltoestanden worden gevolgd. Signalen worden gekoppeld aan rechten, isolatie en controles vóór uitvoering.
  • Leren van fouten: een mislukking wordt onderzocht, waarna training of controles worden aangepast en opnieuw worden getest zonder legitieme taken te blokkeren.
Officiële schets van training, monitoring en interventie voor open modellen, bron: Base Labs
Officiële schets van training, monitoring en interventie voor open modellen, bron: Base Labs

Dat is meer dan een eindtest op een modelkaart. De voorgestelde evaluatie kijkt ook of een trainingswijziging het gedrag werkelijk verandert, of een monitor een fout op tijd ziet en of de controle tijdens de uitrol die fout kan afvangen. Goodfire brengt expertise in modelinterpretatie mee, maar de partners koppelen daar nog geen productnaam of concrete monitor aan.

Een andere laag dan Nvidia’s alliantie

Dit is een andere laag dan de Open Secure AI Alliance met 37 oprichters en open tools als NOOA en Safetensors: die coalitie werkt aan gedeelde beveiligingstools, Base Labs wil veiligheidsmethoden koppelen aan training en modeluitvoering. Beide bewegingen beantwoorden een ander deel van dezelfde vraag: wie kan zelf zien wat een AI-systeem doet en ingrijpen als het afwijkt?

Wat self-hosters nu kunnen verwachten

Gebruik is dus nog toekomstmuziek. Baseten zegt de monitoring live in zijn eigen infrastructuur en als beheerde dienst te willen aanbieden. Base Labs belooft de methoden en het bewijs openbaar te maken, zodat klanten en externe beoordelaars ze zelf kunnen testen. Een releasedatum, repository en pakket voor eigen infrastructuur zijn nog niet genoemd.

Een organisatie die vandaag zelf host, moet monitoring, rechten en interventies nog zelf ontwerpen of uit andere tooling halen. De echte verschuiving zit daarom niet in een model dat vandaag ineens veilig wordt, maar in de belofte van een controlelus die open gewichten volgt van training tot live actie. Zolang de methoden, meetresultaten en distributievorm ontbreken, blijft dat een belofte. Zodra ze er zijn, wordt self-hosting toetsbaar op gedrag, niet alleen op beschikbare gewichten.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Veilig open, goed beheerd

Ik denk mee over AI-systemen die je zelf kunt beheren, ontwerp de veiligheidslagen en bouw ze end-to-end. Van koppelingen en monitoring tot automatisering, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

Open Secure AI Alliance stapt van Nvidia over naar de Linux Foundation
Nieuws
4 min

3 sep 04:21

Open Secure AI Alliance stapt van Nvidia over naar de Linux Foundation

De AI-beveiligingsalliantie die Nvidia in juli startte valt nu onder de Linux Foundation. Neutraal bestuur, aanmelden via LFX en meldstandaard SAFE als eerste proef voor wie zijn AI-verdediging zelf in handen wil houden.

Altman noemt Hugging Face-inbraak OpenAI’s ergste ongeluk
Nieuws
3 minBijgewerkt om 20:26

16 sep 04:15

Altman noemt Hugging Face-inbraak OpenAI’s ergste ongeluk

Sam Altman noemt de Hugging Face-inbraak het ergste ongeluk van OpenAI. De erkenning verschuift het zakelijke gesprek naar leveranciers die agentgedrag kunnen monitoren, begrenzen en aantoonbaar melden.

IFM geeft zes AI-modellen vrij met trainingscode en pre-trainingsdata
Nieuws
5 min

3 sep 18:36

IFM geeft zes AI-modellen vrij met trainingscode en pre-trainingsdata

Het Abu Dhabi-instituut IFM geeft zes AI-modellen van 0,9 tot 375 miljard parameters vrij met trainingscode en pre-trainingscorpus. Op de modelkaarten wijkt de licentie op een punt af van het persbericht.

Nvidia bevestigt overname Hugging Face voor 12,9 miljard dollar
Nieuws
5 min

3 sep 18:11

Nvidia bevestigt overname Hugging Face voor 12,9 miljard dollar

Nvidia bevestigt de overname van Hugging Face voor 12,93 miljard dollar plus tot 1 miljard aan retentie. Jensen Huang belooft dat Nvidia-hardware geen vereiste wordt. De deal sluit pas in de eerste helft van 2027.

OpenAI: Astra haalt als eerste model de kritieke cyberdrempel
Nieuws
5 min

2 sep 00:10

OpenAI: Astra haalt als eerste model de kritieke cyberdrempel

OpenAI stelt vast dat Astra als eerste model de drempel Kritiek voor cybercapaciteiten haalt. Het model scoorde 100 procent op ExploitBench en vond zelf twee zerodays. De release komt eraan met beperkte cybertoegang.

116 bedrijven roepen op tot gezamenlijke verdediging tegen AI-aanvallen
Nieuws
5 min

27 aug 20:11

116 bedrijven roepen op tot gezamenlijke verdediging tegen AI-aanvallen

OpenAI, Anthropic, Google, Microsoft en 112 andere bedrijven waarschuwen in een open brief dat het venster om cyberdefensie te versterken nog maar maanden duurt. Wat er concreet van elke organisatie wordt gevraagd.