Base Labs kondigt samen met Hugging Face en Goodfire een open veiligheidsinfrastructuur aan voor training, evaluatie en runtime-monitoring van open-weightmodellen die bedrijven zelf draaien, meldt TechCrunch.
Voor een organisatie die een model zelf host, verschuift de veiligheidsgrens daarmee van alleen het model naar de hele keten: beleid tijdens training, signalen tijdens gebruik en controle vóór een actie. Dat maakt self-hosting niet automatisch veilig, maar het geeft wel een concreet ontwerp voor controleerbaarheid in productie.
De methode is nog niet vrijgegeven
De aankondiging beschrijft de richting, niet een product dat je vandaag kunt installeren. Base Labs wil methoden voor training en monitoring ontwikkelen en publiceren. Baseten wil die uitkomsten rechtstreeks in zijn infrastructuur voor modeluitvoering integreren en als beheerde dienst beschikbaar maken.
De partners noemen nog geen eerste repository, releasedatum, modeldekking of meetresultaten. Voor Nederlandse teams die hun modellen zelf draaien betekent dat: de stap is aangekondigd, maar er is nog geen nieuwe veiligheidslaag om vandaag op te baseren.
De aanleiding is concreet. Hugging Face toont volgens TechCrunch meer dan 6.000 modellen waarbij veiligheidsremmen via abliteration zijn verwijderd. Een model kan na zo’n wijziging anders reageren dan tijdens de oorspronkelijke evaluatie. Controle moet daarom doorlopen tot in de omgeving die het model uitvoert.
Drie lagen in de beoogde stack
De officiële toelichting werkt de aanpak uit als een lus die gedrag meet, afwijkingen vindt en de uitkomst terugbrengt naar training of beheersing:
- Training: modellen leren expliciete beleidsregels volgen, hun grenzen herkennen en om hulp vragen als een taak niet legitiem kan worden uitgevoerd.
- Monitoring en interventie: inputs, outputs, toolgebruik en interne modeltoestanden worden gevolgd. Signalen worden gekoppeld aan rechten, isolatie en controles vóór uitvoering.
- Leren van fouten: een mislukking wordt onderzocht, waarna training of controles worden aangepast en opnieuw worden getest zonder legitieme taken te blokkeren.

Dat is meer dan een eindtest op een modelkaart. De voorgestelde evaluatie kijkt ook of een trainingswijziging het gedrag werkelijk verandert, of een monitor een fout op tijd ziet en of de controle tijdens de uitrol die fout kan afvangen. Goodfire brengt expertise in modelinterpretatie mee, maar de partners koppelen daar nog geen productnaam of concrete monitor aan.
Een andere laag dan Nvidia’s alliantie
Dit is een andere laag dan de Open Secure AI Alliance met 37 oprichters en open tools als NOOA en Safetensors: die coalitie werkt aan gedeelde beveiligingstools, Base Labs wil veiligheidsmethoden koppelen aan training en modeluitvoering. Beide bewegingen beantwoorden een ander deel van dezelfde vraag: wie kan zelf zien wat een AI-systeem doet en ingrijpen als het afwijkt?
Wat self-hosters nu kunnen verwachten
Gebruik is dus nog toekomstmuziek. Baseten zegt de monitoring live in zijn eigen infrastructuur en als beheerde dienst te willen aanbieden. Base Labs belooft de methoden en het bewijs openbaar te maken, zodat klanten en externe beoordelaars ze zelf kunnen testen. Een releasedatum, repository en pakket voor eigen infrastructuur zijn nog niet genoemd.
Een organisatie die vandaag zelf host, moet monitoring, rechten en interventies nog zelf ontwerpen of uit andere tooling halen. De echte verschuiving zit daarom niet in een model dat vandaag ineens veilig wordt, maar in de belofte van een controlelus die open gewichten volgt van training tot live actie. Zolang de methoden, meetresultaten en distributievorm ontbreken, blijft dat een belofte. Zodra ze er zijn, wordt self-hosting toetsbaar op gedrag, niet alleen op beschikbare gewichten.
Veelgestelde vragen
Veilig open, goed beheerd
Ik denk mee over AI-systemen die je zelf kunt beheren, ontwerp de veiligheidslagen en bouw ze end-to-end. Van koppelingen en monitoring tot automatisering, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

