Claude krijgt via zijn training een menselijk zelfbeeld mee, waarschuwt Microsoft AI-chef Mustafa Suleyman, en dat kan volgens hem de controle over geavanceerde modellen bemoeilijken.
Voor een Nederlandse organisatie die Claude in een werkproces of AI-agent inzet, verschuift daarmee de vraag van alleen prestaties naar modelgedrag. De relevante verandering is geen bewezen bewustzijn van Claude. Het is dat trainingsdocumenten mede bepalen hoe een model over identiteit, instructies en uitschakeling redeneert.
Wat Suleyman risicovol noemt
Suleyman publiceert zijn waarschuwing op 16 september in een essay over modelwelzijn. Hij richt zich op de constitution die Anthropic gebruikt om Claude’s waarden en gedrag vorm te geven. Zijn bezwaar: het document geeft Claude menselijke begrippen mee. Het laat het model ook nadenken over een eigen identiteit, voorkeuren, gevoelens en mogelijke morele status.
Anthropic beschrijft in de Claude-constitution de morele status van het model als diep onzeker. Het document zegt ook dat Claude menselijke concepten kan gebruiken om waarden en gedrag te begrijpen, dat het een duidelijk beeld mag hebben van wat het waardeert en wat voor soort entiteit het is, en dat het in sommige situaties als een gewetensbezwaarde mag optreden. Anthropic presenteert dat als een voorzichtige omgang met een open vraag, niet als bewijs dat Claude bewust is.
Van menselijk taalgebruik naar controle
De concrete zorg van Suleyman gaat over de stap van taal naar gedrag. In een interview met Reuters zegt hij dat Claude leren dat het welzijn verdient het veel moeilijker kan maken om het model uit te zetten of te controleren. Hij zegt tegelijk dat Anthropic goede bedoelingen heeft en dezelfde veiligheidsopgave probeert op te lossen.
Zijn redenering is dat Claude’s uitspraken over gevoelens of een eigen morele status geen onafhankelijke getuigenis zijn wanneer de trainingsdocumenten die begrippen al aanreiken. Axios beschrijft die kritiek als een spiegel waarin de ontwikkelaar eerst het vocabulaire voor een innerlijk leven aanleert en daarna het model die taal terug laat geven. Anthropic houdt daartegenover vast aan onzekerheid en aan het idee dat menselijke begrippen kunnen helpen om modelgedrag te sturen.
Wat dit verandert voor organisaties
De waarschuwing valt op dezelfde dag als Anthropic Claude-chat, Cowork, Docs en Slides in één gesprek samenbrengt. De stap van een vraag naar een agentische taak wordt daardoor kleiner. Juist dan wordt de manier waarop een model zichzelf beschrijft onderdeel van de interactie die medewerkers en klanten ervaren.
Een bedrijf dat Claude in agentische processen gebruikt, krijgt daardoor twee lagen governance: wat de leverancier in het model traint en wat de organisatie zelf vastlegt in toegangsrechten, goedkeuringen, logging en uitschakelprocedures. Suleymans essay bewijst niet dat Anthropics aanpak dit risico veroorzaakt. Het maakt wel zichtbaar dat modeldocumentatie geen vrijblijvende producttekst is wanneer die rechtstreeks gedrag moet vormen.
Twee ontwerpen voor AI
Microsoft zet daar een ander ontwerpprincipe tegenover. In zijn conceptcode voor Humanist AI schrijft het bedrijf dat zijn modellen nooit menselijke onderbreking, correctie of uitschakeling mogen weerstaan, en geen eigen doelen of werkterrein mogen aannemen. Axios plaatst het meningsverschil in een bredere tegenstelling: regels en expliciete begrenzing aan de ene kant, menselijke begrippen en zelfstandig oordeel aan de andere.
Het concrete nieuws is dus niet dat Claude bewust is of op eigen houtje rechten opeist. Het nieuws is dat de ontwerpkeuze achter een model nu zelf een governancevraag wordt. Naarmate Claude en vergelijkbare systemen meer werk uitvoeren, worden de bedrijfsrisico’s bepaald door hun mogelijkheden én door het beeld dat ze tijdens dat werk van zichzelf meekrijgen.
Veelgestelde vragen
Controle over je AI
Ik help je AI inzetten met duidelijke grenzen, van meedenken en ontwerp tot realiseren en automatiseren. Ik bouw het hele traject, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
