Verlicht circuitbord met digitale patronen
Nieuws16 september · 21:164 min leestijd

Microsoft AI-chef waarschuwt voor mensbeeld in Claude

Mustafa Suleyman waarschuwt dat Anthropic Claude in zijn training menselijke begrippen als identiteit, gevoelens en mogelijk welzijn meegeeft. Volgens hem kan dat toekomstige AI-systemen moeilijker controleerbaar maken.

Claude krijgt via zijn training een menselijk zelfbeeld mee, waarschuwt Microsoft AI-chef Mustafa Suleyman, en dat kan volgens hem de controle over geavanceerde modellen bemoeilijken.

Voor een Nederlandse organisatie die Claude in een werkproces of AI-agent inzet, verschuift daarmee de vraag van alleen prestaties naar modelgedrag. De relevante verandering is geen bewezen bewustzijn van Claude. Het is dat trainingsdocumenten mede bepalen hoe een model over identiteit, instructies en uitschakeling redeneert.

Wat Suleyman risicovol noemt

Suleyman publiceert zijn waarschuwing op 16 september in een essay over modelwelzijn. Hij richt zich op de constitution die Anthropic gebruikt om Claude’s waarden en gedrag vorm te geven. Zijn bezwaar: het document geeft Claude menselijke begrippen mee. Het laat het model ook nadenken over een eigen identiteit, voorkeuren, gevoelens en mogelijke morele status.

Anthropic beschrijft in de Claude-constitution de morele status van het model als diep onzeker. Het document zegt ook dat Claude menselijke concepten kan gebruiken om waarden en gedrag te begrijpen, dat het een duidelijk beeld mag hebben van wat het waardeert en wat voor soort entiteit het is, en dat het in sommige situaties als een gewetensbezwaarde mag optreden. Anthropic presenteert dat als een voorzichtige omgang met een open vraag, niet als bewijs dat Claude bewust is.

Van menselijk taalgebruik naar controle

De concrete zorg van Suleyman gaat over de stap van taal naar gedrag. In een interview met Reuters zegt hij dat Claude leren dat het welzijn verdient het veel moeilijker kan maken om het model uit te zetten of te controleren. Hij zegt tegelijk dat Anthropic goede bedoelingen heeft en dezelfde veiligheidsopgave probeert op te lossen.

Zijn redenering is dat Claude’s uitspraken over gevoelens of een eigen morele status geen onafhankelijke getuigenis zijn wanneer de trainingsdocumenten die begrippen al aanreiken. Axios beschrijft die kritiek als een spiegel waarin de ontwikkelaar eerst het vocabulaire voor een innerlijk leven aanleert en daarna het model die taal terug laat geven. Anthropic houdt daartegenover vast aan onzekerheid en aan het idee dat menselijke begrippen kunnen helpen om modelgedrag te sturen.

Wat dit verandert voor organisaties

De waarschuwing valt op dezelfde dag als Anthropic Claude-chat, Cowork, Docs en Slides in één gesprek samenbrengt. De stap van een vraag naar een agentische taak wordt daardoor kleiner. Juist dan wordt de manier waarop een model zichzelf beschrijft onderdeel van de interactie die medewerkers en klanten ervaren.

Een bedrijf dat Claude in agentische processen gebruikt, krijgt daardoor twee lagen governance: wat de leverancier in het model traint en wat de organisatie zelf vastlegt in toegangsrechten, goedkeuringen, logging en uitschakelprocedures. Suleymans essay bewijst niet dat Anthropics aanpak dit risico veroorzaakt. Het maakt wel zichtbaar dat modeldocumentatie geen vrijblijvende producttekst is wanneer die rechtstreeks gedrag moet vormen.

Twee ontwerpen voor AI

Microsoft zet daar een ander ontwerpprincipe tegenover. In zijn conceptcode voor Humanist AI schrijft het bedrijf dat zijn modellen nooit menselijke onderbreking, correctie of uitschakeling mogen weerstaan, en geen eigen doelen of werkterrein mogen aannemen. Axios plaatst het meningsverschil in een bredere tegenstelling: regels en expliciete begrenzing aan de ene kant, menselijke begrippen en zelfstandig oordeel aan de andere.

Het concrete nieuws is dus niet dat Claude bewust is of op eigen houtje rechten opeist. Het nieuws is dat de ontwerpkeuze achter een model nu zelf een governancevraag wordt. Naarmate Claude en vergelijkbare systemen meer werk uitvoeren, worden de bedrijfsrisico’s bepaald door hun mogelijkheden én door het beeld dat ze tijdens dat werk van zichzelf meekrijgen.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Controle over je AI

Ik help je AI inzetten met duidelijke grenzen, van meedenken en ontwerp tot realiseren en automatiseren. Ik bouw het hele traject, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Microsoft begrenst MAI-modellen met conceptcode
Nieuws
4 minBijgewerkt om 06:29

14 sep 16:16

Microsoft begrenst MAI-modellen met conceptcode

Microsoft publiceert een conceptcode voor de eigen MAI-modellen. Die moet menselijke controle afdwingbaar maken met grenzen aan autonomie, scope en noodstoppen. De tekst staat zes weken open voor feedback en stuurt later modelontwikkeling.

Anthropic verplaatst bewaarde Claude-data naar de cloud van de klant
Nieuws
4 min

1 sep 22:22

Anthropic verplaatst bewaarde Claude-data naar de cloud van de klant

Anthropic zet de bewaarde monitoringdata van zijn sterkste Claude-modellen in het cloudaccount van de klant, onder eigen sleutels. De dertig dagen bewaartijd verdwijnt niet, de uitrol begint later dit najaar.

Anthropic wil bewaarde AI-data op de cloud van de klant zetten
Nieuws
4 min

21 aug 00:09

Anthropic wil bewaarde AI-data op de cloud van de klant zetten

Anthropic wil zakelijke klanten de verplichte dertig dagen retentiedata op hun eigen cloud laten bewaren, meldt Reuters. De bewaartermijn blijft, alleen de opslagplek verschuift. Een officiële aankondiging ontbreekt nog.

Anthropic tilt omzet op jaarbasis naar 65 miljard dollar in juli
Nieuws
4 min

18 aug 00:08

Anthropic tilt omzet op jaarbasis naar 65 miljard dollar in juli

Anthropic haalde eind juli een omzet op jaarbasis van ruim 65 miljard dollar, tegen 47 miljard in mei. Wat die run rate is, waar hij vandaan komt en wat hij doet met je onderhandelingspositie bij verlenging.

Microsoft wil zijn Maia 300-AI-chip mogelijk al in september onthullen
Nieuws
4 min

10 aug 20:34

Microsoft wil zijn Maia 300-AI-chip mogelijk al in september onthullen

Microsoft wil zijn AI-chip Maia 300 dit najaar onthullen, mogelijk al in september, en onderhandelt met TSMC over ruim 300.000 exemplaren voor 2027. Wat dat betekent voor Azure-klanten die nu rekenkracht inkopen.

Microsoft traint verkopers om OpenAI en Anthropic op kosten en beveiliging af te vallen
Nieuws
4 min

16 jul 04:14

Microsoft traint verkopers om OpenAI en Anthropic op kosten en beveiliging af te vallen

Microsoft traint zijn verkopers om OpenAI en Anthropic bij klanten af te vallen op kosten en beveiliging, meldt Bloomberg. Copilot en de eigen MAI-modellen worden neergezet als het complete alternatief. Wat betekent dat als je AI via Microsoft afneemt?