OpenAI zegt op 30 september dat het een campagne heeft verstoord om beschermde redeneerstappen uit zijn modellen te halen, en dat het een kerncluster aan Moonshot-gelieerde personen toeschrijft.
Voor Nederlandse organisaties die AI via een externe modeldienst inzetten, maakt dit de beveiliging van modeltoegang onderdeel van het leveranciersrisico. OpenAI zegt dat de betrokkenen geen database binnendrongen, geen versleuteling doorbraken en geen rechtstreekse toegang kregen tot opgeslagen gebruikersgesprekken.
Wat OpenAI openbaar maakt
OpenAI noemt de activiteit adversarial distillation: het op schaal en zonder toestemming gebruiken van antwoorden of redeneerstappen van één model om een ander model te trainen, na te bouwen of te verbeteren. Als voorbeeld beschrijft het bedrijf hoe betrokkenen versleutelde redeneerstappen uit één gesprek kopieerden en een model in een ander gesprek vroegen die te ontcijferen en uit te schrijven.
De activiteit begon volgens OpenAI op 1 juli. Op 24 en 25 juli zag OpenAI 16.000 verzoeken met een relevant extractiepatroon van meer dan 4.000 gebruikers. Later vond het vergelijkbare promptpatronen bij ruim 15.000 gebruikers; die activiteit zegt het bedrijf op 28 juli te hebben verstoord. OpenAI merkt in een voetnoot op dat de cijfers pogingen weergeven en niet noodzakelijk geslaagde extracties.
De toeschrijving blijft beperkt
OpenAI zegt niet te weten of alle betrokkenen bij één actor hoorden. Het schrijft alleen een kerncluster toe aan personen die met Moonshot AI zijn verbonden. Welke OpenAI-modellen de gebruikers benaderden, vermeldt het niet. The Register meldde dat OpenAI geen antwoord gaf op de vraag welke modellen doelwit waren.
Dit is een ander verwijt dan de Witte Huis-beschuldiging dat Moonshot Kimi K3 met Anthropics Fable-model distilleerde. Daar ging het om de herkomst van Kimi K3; OpenAI beschrijft nu verzoeken om redeneerstappen uit eigen modellen. De twee claims staan los van elkaar.
OpenAI zegt dat het frauduleuze accounts blokkeerde, aanmeldings- en infrastructuurcontroles aanscherpte en een route sloot waarmee versleutelde redeneerstappen konden worden herhaald en teruggelezen. Het deelde bevindingen ook via het Frontier Model Forum en met overheidsinstanties.
Voor modelkopers schuift de toegangsroute daarmee nadrukkelijker in de leveranciersbeoordeling. Het gaat om de informatie die via gewone verzoeken zichtbaar kan worden, de detectie van herhaalde patronen en de bescherming van verborgen redeneerstappen. De beschuldiging tegen Moonshot-gelieerde personen blijft onbewezen, maar de beschreven aanvalspaden maken modeltoegang zelf tot een concreet controlepunt.
Veelgestelde vragen
Grip op AI-toegang
Ik denk met je mee over de juiste inrichting en begeleid het hele traject, van ontwerp tot realisatie en automatisering. Waar het kan, richt ik het in op je eigen infrastructuur.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
