FDA financiert Cognita Imaging met 1,29 miljoen dollar voor een test waarin meerdere taalmodellen radiologieverslagen beoordelen op circa één miljoen patiëntonderzoeken, meldt Radiology Partners op 16 september.
Voor een Nederlandse organisatie die AI-uitkomsten in een gereguleerd proces gebruikt, verschuift de evaluatievraag van een kleine steekproef naar dekking en herhaalbaarheid. De inzet is een extra toetslaag die verschillen tussen patiëntgroepen, apparatuur, zorgomgevingen en zeldzame aandoeningen zichtbaar maakt, terwijl radiologen de klinisch belangrijke afwijkingen blijven beoordelen. De deal bewijst dus nog niet dat een LLM-jury betrouwbaar is. Hij financiert het onderzoek dat dat moet uitwijzen.

Meerdere modellen beoordelen hetzelfde verslag
Cognita ontwikkelt en valideert een raamwerk dat zowel door mensen opgestelde als door AI gegenereerde radiologieverslagen laat beoordelen. De methode heet “LLMs-as-a-jury”: niet één taalmodel geeft een ander model een cijfer, maar meerdere modellen leveren naast elkaar een oordeel. Cognita wil daarmee de invloed van de eigenaardigheden van één model verkleinen en onderzoeken waar automatische beoordeling de beoordeling door artsen kan uitbreiden.
Het project wordt geleid door Akshay Chaudhari, medeoprichter van Cognita, hoogleraar radiologie en biomedische datawetenschap aan Stanford, en hoofdonderzoeker van het contract. Louis Blankemeier, medeoprichter en CEO van Cognita, is medeonderzoeker. Het contract ging op 22 juni 2026 in en loopt 18 maanden.
De methode bouwt voort op GREEN, een open-source hulpmiddel van Cognita dat referentieverslagen en AI-verslagen naast elkaar legt en klinisch betekenisvolle verschillen markeert. De FDA-deal schuift die vergelijking op van een hulpmiddel voor afzonderlijke verslagen naar een raamwerk dat ook de betrouwbaarheid van de beoordelaars zelf onderzoekt.
De miljoen onderzoeken testen de blinde vlek
Na de bouw en eerste tests past Cognita het raamwerk toe op ongeveer één miljoen patiëntonderzoeken uit een grote, diverse Amerikaanse populatie. De onderzoekers vergelijken uitkomsten tussen patiëntgroepen, zorgomgevingen, beeldvormingsapparatuur en aandoeningen. Ook zeldzame bevindingen tellen mee, juist omdat die in een kleine testgroep gemakkelijk ontbreken.
Een tweede onderdeel is de steekproefvergelijking. Uit de grote dataset worden kleinere validatiegroepen samengesteld, zodat zichtbaar wordt welke informatie verloren kan gaan als een model met slechts enkele honderden gevallen wordt beoordeeld. Dat maakt de omvang van een AI-test zelf onderdeel van de evaluatie, in plaats van alleen een administratieve keuze.
Een miljoen onderzoeken levert daarmee meer variatie op, maar geen automatisch juiste referentie. De onderzoekers moeten nog steeds bepalen welk menselijk verslag als uitgangspunt geldt en welke verschillen klinisch belangrijk zijn. Precies daarom is menselijke escalatie onderdeel van de methode: de jury filtert en vergelijkt, radiologen beoordelen welke afwijkingen betekenis hebben. Het contract noemt ook de beperkingen van de aanpak als onderzoeksuitkomst.
De jury krijgt geen vrije hand
Radiologen beoordelen de klinisch belangrijke meningsverschillen. Zij onderzoeken of een probleem ontstond in het AI-verslag, in de LLM-jury of in het oorspronkelijke verslag van de radioloog. Cognita gebruikt die uitkomsten om het raamwerk te verbeteren en om te testen hoe automatische controle en menselijke expertise samen kunnen werken bij toelating vooraf en toezicht na ingebruikname.
Het contract valt onder het Broad Agency Announcement-programma van de FDA voor geavanceerd onderzoek naar regelgeving. Cognita levert softwarecode, praktische richtlijnen voor het bouwen van LLM-jury’s, vergelijkingen tussen grote en kleine validatiegroepen, door radiologen beoordeelde afwijkingsanalyses en rapporten over de uitkomsten en beperkingen. Het onderzoek is daarmee geen productgoedkeuring of commerciële toelating.
De verschuiving zit daarom niet in een model dat zelfstandig de medische waarheid vaststelt, maar in een evaluatieproces dat onzekerheid ordent: veel gevallen automatisch vergelijken, afwijkingen naar deskundigen sturen en de beperkingen documenteren. Als deze aanpak werkt, wordt de kwaliteit van gereguleerde AI niet alleen een vraag van modelprestaties, maar ook van de schaal en het ontwerp van de toets die eromheen ligt.
Veelgestelde vragen
AI toetsen met bewijs
Ik denk mee over de evaluatie, ontwerp de architectuur en bouw de automatisering van idee tot live proces, met self-hosted waar dat kan. Zo blijft niet alleen het model, maar ook de bewijsvoering rond je AI beheersbaar.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
