Arts in een witte jas met een rode stethoscoop
Nieuws16 september · 22:414 min leestijd

FDA financiert LLM-jury voor radiologie op 1 miljoen onderzoeken

De FDA geeft Cognita Imaging 1,29 miljoen dollar voor een test waarin meerdere taalmodellen radiologieverslagen beoordelen op circa één miljoen patiëntonderzoeken. Radiologen controleren de klinisch belangrijke afwijkingen.

FDA financiert Cognita Imaging met 1,29 miljoen dollar voor een test waarin meerdere taalmodellen radiologieverslagen beoordelen op circa één miljoen patiëntonderzoeken, meldt Radiology Partners op 16 september.

Voor een Nederlandse organisatie die AI-uitkomsten in een gereguleerd proces gebruikt, verschuift de evaluatievraag van een kleine steekproef naar dekking en herhaalbaarheid. De inzet is een extra toetslaag die verschillen tussen patiëntgroepen, apparatuur, zorgomgevingen en zeldzame aandoeningen zichtbaar maakt, terwijl radiologen de klinisch belangrijke afwijkingen blijven beoordelen. De deal bewijst dus nog niet dat een LLM-jury betrouwbaar is. Hij financiert het onderzoek dat dat moet uitwijzen.

De officiële aankondigingsafbeelding toont de logo’s van Mosaic Clinical Technologies en Cognita. Bron: Radiology Partners
De officiële aankondigingsafbeelding toont de logo’s van Mosaic Clinical Technologies en Cognita. Bron: Radiology Partners

Meerdere modellen beoordelen hetzelfde verslag

Cognita ontwikkelt en valideert een raamwerk dat zowel door mensen opgestelde als door AI gegenereerde radiologieverslagen laat beoordelen. De methode heet “LLMs-as-a-jury”: niet één taalmodel geeft een ander model een cijfer, maar meerdere modellen leveren naast elkaar een oordeel. Cognita wil daarmee de invloed van de eigenaardigheden van één model verkleinen en onderzoeken waar automatische beoordeling de beoordeling door artsen kan uitbreiden.

Het project wordt geleid door Akshay Chaudhari, medeoprichter van Cognita, hoogleraar radiologie en biomedische datawetenschap aan Stanford, en hoofdonderzoeker van het contract. Louis Blankemeier, medeoprichter en CEO van Cognita, is medeonderzoeker. Het contract ging op 22 juni 2026 in en loopt 18 maanden.

De methode bouwt voort op GREEN, een open-source hulpmiddel van Cognita dat referentieverslagen en AI-verslagen naast elkaar legt en klinisch betekenisvolle verschillen markeert. De FDA-deal schuift die vergelijking op van een hulpmiddel voor afzonderlijke verslagen naar een raamwerk dat ook de betrouwbaarheid van de beoordelaars zelf onderzoekt.

De miljoen onderzoeken testen de blinde vlek

Na de bouw en eerste tests past Cognita het raamwerk toe op ongeveer één miljoen patiëntonderzoeken uit een grote, diverse Amerikaanse populatie. De onderzoekers vergelijken uitkomsten tussen patiëntgroepen, zorgomgevingen, beeldvormingsapparatuur en aandoeningen. Ook zeldzame bevindingen tellen mee, juist omdat die in een kleine testgroep gemakkelijk ontbreken.

Een tweede onderdeel is de steekproefvergelijking. Uit de grote dataset worden kleinere validatiegroepen samengesteld, zodat zichtbaar wordt welke informatie verloren kan gaan als een model met slechts enkele honderden gevallen wordt beoordeeld. Dat maakt de omvang van een AI-test zelf onderdeel van de evaluatie, in plaats van alleen een administratieve keuze.

Een miljoen onderzoeken levert daarmee meer variatie op, maar geen automatisch juiste referentie. De onderzoekers moeten nog steeds bepalen welk menselijk verslag als uitgangspunt geldt en welke verschillen klinisch belangrijk zijn. Precies daarom is menselijke escalatie onderdeel van de methode: de jury filtert en vergelijkt, radiologen beoordelen welke afwijkingen betekenis hebben. Het contract noemt ook de beperkingen van de aanpak als onderzoeksuitkomst.

De jury krijgt geen vrije hand

Radiologen beoordelen de klinisch belangrijke meningsverschillen. Zij onderzoeken of een probleem ontstond in het AI-verslag, in de LLM-jury of in het oorspronkelijke verslag van de radioloog. Cognita gebruikt die uitkomsten om het raamwerk te verbeteren en om te testen hoe automatische controle en menselijke expertise samen kunnen werken bij toelating vooraf en toezicht na ingebruikname.

Het contract valt onder het Broad Agency Announcement-programma van de FDA voor geavanceerd onderzoek naar regelgeving. Cognita levert softwarecode, praktische richtlijnen voor het bouwen van LLM-jury’s, vergelijkingen tussen grote en kleine validatiegroepen, door radiologen beoordeelde afwijkingsanalyses en rapporten over de uitkomsten en beperkingen. Het onderzoek is daarmee geen productgoedkeuring of commerciële toelating.

De verschuiving zit daarom niet in een model dat zelfstandig de medische waarheid vaststelt, maar in een evaluatieproces dat onzekerheid ordent: veel gevallen automatisch vergelijken, afwijkingen naar deskundigen sturen en de beperkingen documenteren. Als deze aanpak werkt, wordt de kwaliteit van gereguleerde AI niet alleen een vraag van modelprestaties, maar ook van de schaal en het ontwerp van de toets die eromheen ligt.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

AI toetsen met bewijs

Ik denk mee over de evaluatie, ontwerp de architectuur en bouw de automatisering van idee tot live proces, met self-hosted waar dat kan. Zo blijft niet alleen het model, maar ook de bewijsvoering rond je AI beheersbaar.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

AWS bewaakt productie-agents met Evaluations en DevOps Agent
Nieuws
5 min

11 sep 22:11

AWS bewaakt productie-agents met Evaluations en DevOps Agent

AWS koppelt live kwaliteitsmetingen voor productie-agents aan geautomatiseerd oorzaakonderzoek. AgentCore Evaluations scoort een steekproef van interacties asynchroon, terwijl DevOps Agent IAM-, CloudWatch- en runtime-sporen samenbrengt bij incidenten.

Stanford leert AI-agents wanneer ze menselijke hulp vragen
Nieuws
4 min

10 sep 22:54

Stanford leert AI-agents wanneer ze menselijke hulp vragen

Stanford-onderzoekers laten AI-agents leren wanneer ze zelfstandig handelen en wanneer ze menselijke hulp vragen. De evaluaties koppelen die escalatie aan veiligheidsgrenzen, bevoegdheden en toezicht in echte bedrijfsworkflows.

Seattle Times en Newsday eisen vernietiging van AI-modellen met hun artikelen
Nieuws
5 min

5 sep 08:08

Seattle Times en Newsday eisen vernietiging van AI-modellen met hun artikelen

The Seattle Times en Newsday eisen in een dagvaarding van 4 september de vernietiging van alle AI-modellen en trainingsdatasets met hun artikelen. Die eis raakt niet je rekening, maar de beschikbaarheid van ChatGPT en Copilot.

VVD stelt Kamervragen over datastromen van Chinese medische apparatuur
Nieuws
5 min

1 sep 14:24

VVD stelt Kamervragen over datastromen van Chinese medische apparatuur

Twee VVD-Kamerleden vragen het kabinet wie de updates en het onderhoud doet op Chinese medische apparatuur in Nederlandse ziekenhuizen. Dezelfde inkoopvraag speelt bij elk bedrijf dat verbonden hardware van buiten de EU aanschaft.

OpenAI rekent bij grote klanten alleen af als de AI de taak afmaakt
Nieuws
4 min

31 aug 18:11

OpenAI rekent bij grote klanten alleen af als de AI de taak afmaakt

OpenAI laat een deel van zijn grootzakelijke klanten pas betalen als de AI een taak afrondt. Daarmee verschuift de rekening van tokens naar uitkomsten, en wordt de definitie van geslaagd het echte onderhandelpunt.

Stanford: instapbanen in AI-beroepen lopen 19 procent achter
Nieuws
5 min

25 aug 04:11

Stanford: instapbanen in AI-beroepen lopen 19 procent achter

Instapbanen in de meest AI-blootgestelde beroepen lopen 19 procent achter op vergelijkbare functies, meet Stanford in Amerikaanse loondata. De daling loopt via minder aannames en niet via ontslagen, en raakt alleen 22- tot 25-jarigen.