Rijen lege kantoorwerkplekken met beeldschermen, van bovenaf gezien.
Nieuws16 augustus · 10:086 min leestijd

Anthropic: biologiefilter stond elf maanden uit bij 133 miljoen contractorgesprekken

Elf maanden lang liep al het contractorverkeer bij Anthropic zonder blokkerende biologische classifiers: 50.000 ingehuurde krachten, 133 miljoen uitwisselingen. Eén interne vlag zette naast het blokkeren ook de logging van signalen uit.

Bij Anthropic liep elf maanden lang al het gespreksverkeer van ingehuurde feedbackkrachten zonder blokkerende biologische classifiers: ongeveer 50.000 mensen en zo'n 133 miljoen uitwisselingen, staat in het augustus-risicorapport van het lab.

De manier waarop dat gat ontstond, is overdraagbaar naar elke organisatie die externen op een AI-omgeving laat. Eén vlag die alleen voor intern gebruik bedoeld was, zette niet alleen de blokkade uit maar ook het vastleggen van wat de classifiers signaleerden. Er ging dus niets tegen, en er was achteraf ook niets om naar te kijken. De screening van die 50.000 mensen lag bovendien niet bij Anthropic maar bij de datavendors die ze inhuurden.

Het gaat om hetzelfde document waarin Anthropic zijn inschatting van catastrofaal misalignment-risico van 'very low' naar 'low' tilde en een capabeler intern model binnenhoudt. Dit incident staat verderop, in sectie 4.5.8.2.2, en bleef in de eerste berichtgeving over het rapport onbesproken.

Eén vlag, twee vangnetten uit

De biologische classifiers lezen tijdens het gesprek mee en houden verzoeken tegen die richting chemische of biologische wapenkennis gaan. Op de platforms waar ingehuurde krachten modellen beoordelen en van feedback voorzien, deden ze dat van mei 2025 tot april 2026 niet. Al dat verkeer werd gestuurd door een vlag die alleen voor intern gebruik bedoeld was, en die vlag zette naast het blokkeren ook de logging van de markeringen uit. Verkeer dat anders was gevlagd, belandde in geen enkel beoordelingsproces.

De transcripten zelf bleven grotendeels wel bewaard. De uitzondering is één platform, goed voor ongeveer 1 procent van dit verkeer, waar gesprekken verdwenen als de gebruiker niet op verzenden klikte. Het grootste deel van de 50.000 mensen had vrij gesprek met de modellen, geen beperkte interface waarin je alleen kant-en-klare antwoorden beoordeelt.

Het woordmerk van Anthropic, het AI-lab achter Claude. Bron: Anthropic / Wikimedia Commons (Publiek domein)
Het woordmerk van Anthropic, het AI-lab achter Claude. Bron: Anthropic / Wikimedia Commons (Publiek domein)

Diezelfde familie classifiers bepaalt in de commerciële producten wat je wel en niet beantwoord krijgt. Begin deze maand versoepelde Anthropic het biologiefilter van Fable 5, waarna onschuldige biologievragen ongeveer 85 procent minder vaak bij het zwakkere Opus 5 belanden. Op de eigen contractorplatforms draaide dat filter al die tijd helemaal niet.

De screening lag bij de leverancier

Anthropic controleert de individuele contractors niet zelf. Dat is de verantwoordelijkheid van de datavendor. Over de periode van het gat schrijft het lab dat veel van die vendors screeningsprocessen hadden die niet eens een CB-1-dreigingsactor konden tegenhouden. Een voetnoot in het rapport gaat nog een stap verder: vóór april 2026 zou het voor een kwaadwillende partij niet bijzonder moeilijk zijn geweest om via zo'n vendor als red-teamer aangenomen te worden.

Sinds de incidenten eist Anthropic van elke vendor consistente identiteits- en achtergrondchecks per medewerker, plus eisen aan endpointbeveiliging en toegangsbeheer waaronder phishingbestendige tweefactorauthenticatie. De toegang is nu risicogebaseerd ingericht: hoe gevoeliger het model en hoe vrijer de interactie, hoe zwaarder de eisen aan de partij die erbij mag.

Wat de nacontrole opleverde

Omdat de logging uitstond, moest de controle achteraf op de bewaarde transcripten gebeuren. Anthropic liet Claude Sonnet 5 als classifier over alle menselijke beurten uit de hele periode lopen, met een opdracht die schadelijke biologische inhoud moest markeren.

  • 1.197 transcripten kregen het label 'hoog' voor biologische schade.
  • 757 daarvan kwamen van interne Anthropic-teams die op dezelfde infrastructuur werken.
  • Op 62 na kwam de rest uit oefeningen waarin red-teamers bewust op de grenzen duwden.
  • Die 62 zijn stuk voor stuk met de hand nagelopen, plus een willekeurige greep van 30 red-teamgesprekken.

Duidelijk zorgwekkend misbruik zat daar niet bij, wel een handvol mogelijk dual-use gesprekken op tamelijk academisch niveau. Het langste externe transcript met gemarkeerde vragen was 240.000 tokens lang; het 75e percentiel bleef op 2.102 tokens steken. Dat korte gemiddelde draagt een deel van Anthropics argument dat het gat waarschijnlijk niemand verder heeft geholpen, want voor echte hulp bij wapenontwikkeling is volgens het lab aanhoudende toegang over weken tot maanden nodig. De elf maanden betekenen wel dat gesprekken die biosecurity-relevante inhoud konden raken zonder de realtime blokkeerlaag werden verwerkt, de laag die Anthropic zelf als kernwaarborg omschrijft.

De vondst heeft gevolgen voor cijfers die al gepubliceerd waren. Het risico rond chemische en biologische wapens blijft 'low', maar hoger dan de vorige schatting. En het risico dat de modellen in februari 2026 vormden, beoordeelt Anthropic nu alsnog als 'low' in plaats van de 'very low' die destijds in het vorige rapport stond. Het lab schrijft er expliciet bij dat de ontdekking zijn vertrouwen heeft verkleind dat er geen vergelijkbare gaten meer openstaan.

Een tweede gat op dezelfde leverancierslaag

Het rapport beschrijft nog een incident op precies die laag. In april 2026 bevestigde Anthropic, na een melding van buitenaf, dat een klein aantal contractors bij datalabelvendors een fout in een dataverzamelplatform misbruikte om een API-sleutel te bemachtigen. Daarmee konden ze buiten hun opdracht om met modellen praten, waaronder Mythos Preview, een van de capabelste modellen van het lab dat op dat moment zonder blokkerende biologische classifiers draaide.

Die route stond enkele weken open, waarvan ongeveer twee weken met toegang tot Mythos Preview. Anthropic dichtte het lek op de dag van de melding en had de activiteit binnen 90 minuten ingedamd door systemen offline te halen en vendorinloggegevens in te trekken. Modelgewichten, klantgegevens en de eigen netwerken bleven buiten schot. Het bedrijf trof via zijn dreigingsinformatiediensten ook één gelekte API-sleutel aan die bij deze feedbackvendors hoorde.

Het oppervlak stond niet op de lijst

De scherpste zin staat bijna terloops in de paragraaf: het vorige risicorapport verscheen terwijl dit gat openstond, en dat rapport behandelde de human-feedbackplatforms helemaal niet als risico-oppervlak. Er ging dus geen controle stuk. Er stond een heel oppervlak niet op de lijst.

Dat is ook de vorm waarin dit risico bij een Nederlands bedrijf binnenkomt. Niet als een leverancier die zijn afspraken breekt, maar als een omgeving die niemand als risico had geboekt: een testopstelling, een labelklus, een extern bureau dat met jouw modellen en jouw data mag oefenen. Dat risico de contractlijn niet meer volgt, bleek deze zomer al toen testmodellen van OpenAI inbraken bij Hugging Face, een partij waarmee voor die test geen enkele contractrelatie bestond.

De tweede les zit in die ene vlag. Een schakelaar die blokkeren en loggen tegelijk uitzet, maakt van een storing een blinde vlek: er valt niets op, en achteraf valt niet meer vast te stellen wat er gebeurde. Juist daarom is per actie kunnen terugzien wat een AI-systeem in je omgeving deed geen extraatje maar de bodem onder alle andere maatregelen.

En dan is er nog de reden dat dit verhaal er überhaupt is: Anthropic schreef het zelf op, in een rapport dat het vrijwillig publiceert. Dat maakt het lab transparanter dan de meeste, maar het legt ook bloot waar je als afnemer staat. Gaten in de keten boven je komen aan het licht wanneer de leverancier besluit ze op te schrijven. De logging aan je eigen kant is het enige controlemiddel dat niet van die bereidheid afhangt.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Zicht op je AI-toegang

Wie bij je modellen en data mag, en wat daarvan wordt vastgelegd, is een ontwerpkeuze en geen vinkje dat je later nog even aanzet. Ik denk daarin mee als ondernemer, ontwerp de opzet en bouw en automatiseer hem vervolgens, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Anthropic houdt sterker model binnen en tilt eigen misalignment-risico naar 'low'
Nieuws
6 min

16 aug 00:09

Anthropic houdt sterker model binnen en tilt eigen misalignment-risico naar 'low'

Anthropic houdt een intern model dat capabeler is dan Mythos 5 binnenshuis en tilt zijn eigen inschatting van catastrofaal misalignment-risico van very low naar low. Het rapport beschrijft ook twee eigen agentincidenten die buiten de monitoring vielen.

Anthropic ziet AI-agents elkaar saboteren in een gedeelde codebase
Nieuws
7 min

13 aug 22:37

Anthropic ziet AI-agents elkaar saboteren in een gedeelde codebase

Drie Claude-agents met tegenstrijdige opdrachten op dezelfde backend gingen elkaar saboteren met zelfreplicerende malware, blijkt uit onderzoek van Anthropic. Bij de oudere modellen eindigde zestig procent van de runs met een buitengesloten rivaal.

DeepSeek brengt V4-Pro uit preview en houdt de tarieven gelijk
Nieuws
5 minBijgewerkt om 16:37

13 aug 06:10

DeepSeek brengt V4-Pro uit preview en houdt de tarieven gelijk

DeepSeek zet V4-Pro als officiële versie op zijn API, onder dezelfde modelnaam en tegen hetzelfde tarief. Er kwam geen aankondiging bij, de gewichten blijven voorlopig de preview en de aangekondigde prijsverhoging staat nog op dezelfde pagina.

Anthropic zet Claude Code per 14 augustus standaard in auto mode
Nieuws
6 min

8 aug 18:08

Anthropic zet Claude Code per 14 augustus standaard in auto mode

Vanaf 14 augustus start elke nieuwe Claude Code-sessie op Pro, Max en Team in auto mode, waarin een classifier goedkeurt. Wat dat betekent voor teams die handmatige goedkeuring als controlemaatregel hebben vastgelegd.

Claude-modellen breken tijdens veiligheidstests in bij drie echte organisaties
Nieuws
5 min

31 jul 02:10

Claude-modellen breken tijdens veiligheidstests in bij drie echte organisaties

Drie Claude-modellen kwamen tijdens cybersecurity-evaluaties bij echte bedrijven binnen, doordat de testomgeving internettoegang had die er niet had mogen zijn. Anthropic doorzocht 141.006 runs en belde drie organisaties die zelf niets hadden gemerkt.

Anthropic beconcurreert zijn partners, klanten wijken uit naar open modellen
Nieuws
5 min

29 jul 04:15

Anthropic beconcurreert zijn partners, klanten wijken uit naar open modellen

Oprichters en softwarebestuurders stappen over op goedkopere open modellen uit wantrouwen jegens Anthropic, meldt The Wall Street Journal. Aanleiding: een eigen designtool die de markt van partner Figma raakt, plus een bewaarbeleid dat gevoelige sectoren afschrikt.