Iemand werkt aan een bureau met een computer en stapels papieren documenten
Nieuws23 juni · 17:205 min leestijd

Mistral OCR 4: documentherkenning die zegt hoe zeker ze is

Mistral bracht OCR 4 uit: documentherkenning met bounding boxes, blokclassificatie en confidence scores per woord. Vooral die zekerheidsscores maken factuur- en contractverwerking betrouwbaarder te automatiseren.

Het Franse Mistral heeft vandaag OCR 4 uitgebracht, de nieuwe versie van zijn documentherkenningsmodel. Het zet gescande PDF's, foto's en kantoorbestanden om in schone tekst of gestructureerde JSON, en doet dat nu met drie toevoegingen die voor automatisering echt uitmaken: bounding boxes die aangeven waar op de pagina elk stuk tekst staat, blokclassificatie die titels, tabellen, formules en handtekeningen uit elkaar houdt, en confidence scores die per pagina en per woord laten zien hoe zeker het model is. Volgens Mistral verkozen onafhankelijke beoordelaars OCR 4 boven elk getest OCR- en document-AI-systeem, met een gemiddeld winpercentage van 72%.

Dat klinkt als een incrementele update, maar voor wie documenten verwerkt zit de winst juist in dat laatste punt: een model dat niet alleen leest, maar ook aangeeft waar het twijfelt.

Waarom confidence scores het verschil maken

De meeste OCR-modellen geven je een platte tekstuitvoer en laten je in het ongewisse over hoe betrouwbaar die is. Een verkeerd gelezen bedrag of IBAN ziet er net zo zelfverzekerd uit als een correct gelezen veld. Daar gaat het mis bij automatisering: je weet niet welke regels je blind kunt vertrouwen en welke een mens moet nakijken, dus controleer je voor de zekerheid alles, of je vertrouwt blind en accepteert fouten.

Met inline confidence scores verschuift dat. Je kunt een verwerkingsstroom bouwen die velden met een hoge zekerheid automatisch doorzet en alleen de twijfelgevallen naar een mens routeert. Een factuur waarvan elk veld met hoge zekerheid is uitgelezen, gaat rechtstreeks de boekhouding in; eentje met een wazige scan of een onzeker bedrag belandt in een controlewachtrij. Dat is precies de drempel waarop veel automatiseringsprojecten sneuvelen, en OCR 4 geeft je het signaal om die drempel zelf te zetten.

De bounding boxes en blokclassificatie versterken dat. Omdat het model weet dat iets een tabel, een handtekening of een totaalregel is, en weet waar op de pagina dat staat, kun je gericht de velden eruit halen die je nodig hebt in plaats van een lap tekst na te pluizen. Voor contracten, formulieren en facturen scheelt dat een hoop nabewerking.

Wat er verder in zit

OCR 4 ondersteunt 170 talen verdeeld over 10 taalgroepen, met volgens Mistral sterke prestaties op zeldzame en minder voorkomende talen. Het verwerkt PDF, Word, PowerPoint en OpenDocument, en levert zowel markdown als JSON met een eigen schema, zodat de uitvoer direct bruikbaar is in een vervolgstap. Op de benchmarks OlmOCRBench (85,20) en OmniDocBench (93,07) claimt Mistral een toppositie.

De stappen volgen elkaar snel op. Mistral bracht zijn eerste OCR-model uit in maart 2025 en zette in december 2025 OCR 3 neer, dat toen een winpercentage van 74% haalde tegenover de vorige versie op formulieren, scans, complexe tabellen en handschrift. Een halfjaar later is de lat verlegd van "beter dan onszelf" naar "beter dan de rest".

Prijs en beschikbaarheid

De API kost 4 dollar per 1.000 pagina's, de batch-variant de helft daarvan (2 dollar), en de uitgebreidere Document AI 5 dollar per 1.000 pagina's. Dat is een verdubbeling ten opzichte van OCR 3, dat op 2 dollar per 1.000 pagina's stond, dus reken voor grote volumes opnieuw. Het model draait via Mistral Studio en is daarnaast beschikbaar op Amazon SageMaker en Microsoft Foundry, met Snowflake op komst.

Interessanter voor wie met gevoelige documenten werkt: OCR 4 is ook self-hosted te draaien in een enkele container, zodat facturen, contracten en personeelsdossiers je eigen infrastructuur niet verlaten. Voor een Europees model, van een aanbieder die zich nadrukkelijk op digitale soevereiniteit en een Europees alternatief voor Amerikaanse AI profileert, is dat een logische en welkome optie.

Wat betekent dit voor jou

Als je nu al facturen, bonnen of formulieren laat uitlezen, is de praktische vraag niet of OCR 4 een paar procent nauwkeuriger is, maar of die confidence scores je toelaten meer te automatiseren met minder controle. Een proces waarin je inkomende facturen automatisch laat uitlezen en in je boekhouding boekt wordt pas echt betrouwbaar als je weet welke regels je blind kunt vertrouwen. Een model dat zijn eigen twijfel kwantificeert, geeft je dat handvat.

Tegelijk is dit geen knip-en-klaar product maar een bouwsteen. De waarde zit niet in het model zelf, maar in de stroom eromheen: welke drempel je kiest, waar twijfelgevallen heen gaan, en hoe de uitvoer in Moneybird of Exact belandt. De techniek om documenten te lezen is in een jaar tijd commodity geworden; het verschil zit in hoe je het inricht.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Van document naar werkende stroom

Documenten laten uitlezen is tegenwoordig het makkelijke deel; de winst zit in de stroom eromheen. Ik denk met je mee, ontwerp de drempels en bouw de automatisering die je facturen en contracten end-to-end verwerkt, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

AI inzetten in je accountantspraktijk: van data-invoer tot klantenrapportage
Gids
8 min

26 jun 15:01

AI inzetten in je accountantspraktijk: van data-invoer tot klantenrapportage

Op de meeste accountantskantoren is AI al binnen, maar het draait vooral op tekstwerk. In deze gids loop ik de hele keten af: van bankafschrift en factuur automatisch binnen tot een klantrapportage die vooruitkijkt.

Witte Huis rondt AI-cybertests af en spreekt dinsdag met OpenAI, Anthropic, Google en Meta
Nieuws
4 min

4 aug 00:11

Witte Huis rondt AI-cybertests af en spreekt dinsdag met OpenAI, Anthropic, Google en Meta

Het Witte Huis rondde de vrijwillige cybertests voor frontier-AI af en zit dinsdag om tafel met OpenAI, Anthropic, Google en Meta. De normen blijven geclassificeerd, terwijl Brussel sinds 2 augustus wel kan handhaven.

Microsoft financiert Mistrals Europese AI-compute en laat bedrijven de modellen afgeschermd draaien
Nieuws
4 min

21 jul 16:12

Microsoft financiert Mistrals Europese AI-compute en laat bedrijven de modellen afgeschermd draaien

Microsoft gaat miljarden uitgeven aan Mistrals Europese rekencapaciteit en laat gereguleerde bedrijven de frontier-modellen voortaan volledig losgekoppeld draaien, tot en met een installatie zonder verbinding naar buiten.

Mistral-CEO Mensch waarschuwt voor gesloten AI-modellen
Nieuws
4 min

5 jul 22:50

Mistral-CEO Mensch waarschuwt voor gesloten AI-modellen

Mistral-oprichter Arthur Mensch waarschuwt bedrijven dat gesloten AI-modellen leveranciers zicht geven op hun bedrijfsprocessen. Wat zijn advies waard is bij een keuze tussen open en gesloten AI, met de kanttekening dat hij zelf belanghebbend is.

iDEAL wordt Wero: wat je nu controleert in je checkout, contract en boekhoudkoppeling
Gids
Uitgebreide gids13 min

14 aug 09:00

iDEAL wordt Wero: wat je nu controleert in je checkout, contract en boekhoudkoppeling

Je betaaldienstverlener regelt de overgang naar Wero, maar niet de regels eronder. Deze gids loopt de vier lagen langs die echt breken, van je checkout tot je afletterregels, met per laag een controle die je vandaag al doet.

Inhuurdossier per opdracht: zo bewijs je onder de Wet DBA dat je zzp'er echt zelfstandig werkte
Gids
Uitgebreide gids13 min

13 aug 17:00

Inhuurdossier per opdracht: zo bewijs je onder de Wet DBA dat je zzp'er echt zelfstandig werkte

Een getekende modelovereenkomst bewijst niets over hoe er feitelijk gewerkt is. Deze gids laat zien welke negen dingen je per opdracht moet kunnen tonen, uit welk systeem ze komen en hoe je dat inricht.