Stanford-onderzoek leert AI-agents om bij risicovolle of onzekere stappen menselijke hulp te vragen, terwijl mensen leren wanneer ze moeten ingrijpen, schrijft Stanford GSB.
Voor een Nederlandse ondernemer verandert daarmee de plek van menselijke controle. Die hoort niet pas na een fout of op elke afzonderlijke stap, maar precies bij acties waarvan impact, omkeerbaarheid of onzekerheid te groot is voor zelfstandig handelen.
De agent kiest tussen doen en vragen
William Overman en Mohsen Bayati modelleren de samenwerking als een spel met twee keuzes. De agent kiest tussen play, zelfstandig handelen, en ask, uitstel naar een mens. De mens kiest tussen trust, doorlaten, en oversee, ingrijpen. Uitstel en toezicht kosten iets, zodat geen van beide partijen voor elke stap op de ander leunt.
In het experiment Lavaland loopt de agent over een raster met gevaarlijke vakken die hij aanvankelijk niet herkent. Na herhaalde pogingen leert hij om hulp te vragen wanneer hij een risicopunt nadert. De mens leert vervolgens wanneer een interventie nodig is en wanneer de agent vrij kan handelen. De eerste paper beschrijft ook een agentische programmeertaak met twee taalmodellen van 30 miljard parameters die onafhankelijk leren samenwerken.
Van demonstratie naar meetbare grens
De tweede paper richt zich op een model dat je niet zelf hebt gebouwd en niet volledig vertrouwt. Calibrated Collective Oversight bundelt signalen van meerdere zwakkere menselijke of AI-toezichthouders en verhoogt de terughoudendheid van de agent wanneer die signalen samen risico aangeven. De gebruiker stelt daarbij een doel voor ongewenste uitkomsten in, waarna de methode de veiligheidsmarge tijdens het gebruik bijstelt.
De aanpak is getest op een aangepaste versie van SWE-bench voor softwaretaken en op MACHIAVELLI, een omgeving waarin agents afwegen hoe ze een taak uitvoeren zonder ethische grenzen te overschrijden. In de OpenReview-versie van het paper kwam CCO met GPT-5.4 als sterk model en een doel van 10 procent in een fase met meer risicovolle gevallen uit op 11,1 procent ongewenste uitkomsten, tegenover 15,5 procent bij adaptieve meerderheidsstemming.
Die cijfers komen uit gecontroleerde taken, niet uit bedrijfsprocessen. De eerste methode vraagt herhaald oefenen in de omgeving waarin een agent straks werkt. CCO is volgens de onderzoekers dichter bij praktisch gebruik, maar ook dat resultaat zegt nog niet hoe een financiële workflow, klantenservice of productieomgeving zich gedraagt.
Wat dit verandert in een bedrijfsworkflow
De les is niet dat elke agent voortdurend moet wachten op een mens. De les is dat autonomie aan voorwaarden wordt gekoppeld. Dat sluit aan op een workflow waarin je per agent-actie bepaalt wie mag doorgaan en wat er bij een timeout gebeurt.
- Beslismoment: een actie met hoge impact, lage omkeerbaarheid of een onduidelijke opdracht vraagt escalatie. Een interne samenvatting vraagt een andere controle dan een betaling, klantbericht of wijziging in productiegegevens.
- Bevoegdheid: voorstellen en uitvoeren blijven gescheiden. Een agent kan een actie voorbereiden, terwijl een aangewezen persoon de parameters aanpast, goedkeurt of stopt.
- Toezicht: een aangewezen eigenaar, een vast kanaal en een timeout bepalen wat er bij geen reactie gebeurt. Een goedkeuringsknop zonder eigenaar of fallback is geen toezicht.
De Stanford-onderzoekers maken daarmee een ontwerpkeuze zichtbaar: menselijke controle is geen algemene stand van de agent, maar een aangeleerde beslissing per moment. Een agent is pas beheersbaar wanneer hij zijn handelingsruimte kent, risico herkent en de bevoegdheid om door te gaan kan teruggeven. Voor Nederlandse organisaties maakt dat de grens tussen voorstel en uitvoering tot een technisch en organisatorisch onderdeel van elke agentworkflow.
Veelgestelde vragen
Agents met een veilige grens
Ik ontwerp en bouw AI-agents die weten wanneer ze zelfstandig kunnen handelen en wanneer jouw team moet beslissen, van meedenken en ontwerp tot realiseren en automatiseren. Waar het kan, houd ik de workflow self-hosted en onder jouw controle.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

