Een open laptop met code op het scherm en blauwe en roze verlichting.
Nieuws1 oktober · 00:402 min leestijd

OpenAI koppelt Moonshot-gelieerden aan distillatiepoging

OpenAI zegt een campagne te hebben verstoord die verborgen redeneerstappen uit zijn modellen probeerde te halen. Het schrijft een kerncluster toe aan Moonshot-gelieerde personen, maar zegt niet dat extractie is geslaagd.

OpenAI zegt op 30 september dat het een campagne heeft verstoord om beschermde redeneerstappen uit zijn modellen te halen, en dat het een kerncluster aan Moonshot-gelieerde personen toeschrijft.

Voor Nederlandse organisaties die AI via een externe modeldienst inzetten, maakt dit de beveiliging van modeltoegang onderdeel van het leveranciersrisico. OpenAI zegt dat de betrokkenen geen database binnendrongen, geen versleuteling doorbraken en geen rechtstreekse toegang kregen tot opgeslagen gebruikersgesprekken.

Wat OpenAI openbaar maakt

OpenAI noemt de activiteit adversarial distillation: het op schaal en zonder toestemming gebruiken van antwoorden of redeneerstappen van één model om een ander model te trainen, na te bouwen of te verbeteren. Als voorbeeld beschrijft het bedrijf hoe betrokkenen versleutelde redeneerstappen uit één gesprek kopieerden en een model in een ander gesprek vroegen die te ontcijferen en uit te schrijven.

De activiteit begon volgens OpenAI op 1 juli. Op 24 en 25 juli zag OpenAI 16.000 verzoeken met een relevant extractiepatroon van meer dan 4.000 gebruikers. Later vond het vergelijkbare promptpatronen bij ruim 15.000 gebruikers; die activiteit zegt het bedrijf op 28 juli te hebben verstoord. OpenAI merkt in een voetnoot op dat de cijfers pogingen weergeven en niet noodzakelijk geslaagde extracties.

De toeschrijving blijft beperkt

OpenAI zegt niet te weten of alle betrokkenen bij één actor hoorden. Het schrijft alleen een kerncluster toe aan personen die met Moonshot AI zijn verbonden. Welke OpenAI-modellen de gebruikers benaderden, vermeldt het niet. The Register meldde dat OpenAI geen antwoord gaf op de vraag welke modellen doelwit waren.

Dit is een ander verwijt dan de Witte Huis-beschuldiging dat Moonshot Kimi K3 met Anthropics Fable-model distilleerde. Daar ging het om de herkomst van Kimi K3; OpenAI beschrijft nu verzoeken om redeneerstappen uit eigen modellen. De twee claims staan los van elkaar.

OpenAI zegt dat het frauduleuze accounts blokkeerde, aanmeldings- en infrastructuurcontroles aanscherpte en een route sloot waarmee versleutelde redeneerstappen konden worden herhaald en teruggelezen. Het deelde bevindingen ook via het Frontier Model Forum en met overheidsinstanties.

Voor modelkopers schuift de toegangsroute daarmee nadrukkelijker in de leveranciersbeoordeling. Het gaat om de informatie die via gewone verzoeken zichtbaar kan worden, de detectie van herhaalde patronen en de bescherming van verborgen redeneerstappen. De beschuldiging tegen Moonshot-gelieerde personen blijft onbewezen, maar de beschreven aanvalspaden maken modeltoegang zelf tot een concreet controlepunt.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Grip op AI-toegang

Ik denk met je mee over de juiste inrichting en begeleid het hele traject, van ontwerp tot realisatie en automatisering. Waar het kan, richt ik het in op je eigen infrastructuur.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Chinese militaire onderzoekers trainen defensiesystemen op output van OpenAI en Anthropic
Nieuws
5 min

31 jul 12:12

Chinese militaire onderzoekers trainen defensiesystemen op output van OpenAI en Anthropic

Reuters vond in ruim tachtig Chinese papers en patenten dat aan het leger gelieerde onderzoekers output van OpenAI- en Anthropic-modellen gebruiken voor drones, doelherkenning en socialemediamonitoring. Dat verhardt het debat over modeltoegang.

OpenAI tekent alsnog de open-weight-brief, Anthropic en Google blijven weg
Nieuws
4 min

25 jul 10:15

OpenAI tekent alsnog de open-weight-brief, Anthropic en Google blijven weg

OpenAI staat sinds vrijdagavond alsnog op de open-weight-brief aan Washington, die inmiddels 35 ondertekenaars telt. Anthropic en Google blijven als enige grote frontier-aanbieders buiten de coalitie die pleit tegen beperkingen op open modellen.

VS en China plannen AI-veiligheidsoverleg voor half september
Nieuws
4 min

5 sep 06:09

VS en China plannen AI-veiligheidsoverleg voor half september

De VS en China willen half september voor het eerst exclusief over AI-veiligheid praten, meldt Reuters op basis van twee ingewijden. Op de voorgestelde agenda staat ook de distillatie van Amerikaanse modellen door Chinese labs.

VS werkt aan exportregel die Chinese huur van AI-chips via Thailand en Singapore verbiedt
Nieuws
4 min

30 aug 02:23

VS werkt aan exportregel die Chinese huur van AI-chips via Thailand en Singapore verbiedt

Washington schrijft aan een regel die Chinese bedrijven verbiedt Amerikaanse AI-chips te huren via datacenters in Thailand en Singapore. De conceptregel gaat mogelijk in september naar de industrie, maar de bevoegdheid ontbreekt nog.

Moonshot vraagt Microsoft, Amazon en Google tot 30 procent van de Kimi K3-omzet
Nieuws
4 min

26 aug 22:35

Moonshot vraagt Microsoft, Amazon en Google tot 30 procent van de Kimi K3-omzet

Moonshot vraagt volgens Reuters tot 30 procent van de omzet die Microsoft, Amazon en Google met Kimi K3 zouden maken. De gesprekken bepalen of je het Chinese topmodel straks gewoon als clouddienst inkoopt.

Onderzoekers lezen verborgen AI-redeneringen uit en vinden 182 credentials in publieke logs
Nieuws
5 min

11 aug 20:24

Onderzoekers lezen verborgen AI-redeneringen uit en vinden 182 credentials in publieke logs

Onderzoekers van de Universiteit Tübingen en Snyk ontcijferden de verborgen denkstappen van Claude, GPT en Gemini via de API's zelf. In publieke agent-logs vonden ze 62 API-sleutels en 33 wachtwoorden.