Een browser toont Google-zoeksuggesties in een zoekveld.
Nieuws8 oktober · 08:154 min leestijd

Perplexity lanceert late-interactionmodellen voor tekst en beeld

Perplexity introduceert twee retrievalmodellen die tekst en documentafbeeldingen token voor token vergelijken. De compacte 0,6B-variant kan lokaal vragen verwerken op een index die met de 9B-variant is gebouwd.

Perplexity lanceert pplx-embed-v2-late, twee late-interactionmodellen die tekst, afbeeldingen en visuele documentpagina’s doorzoeken in uitvoeringen van 0,6B en 9B, maakte Perplexity Research op 7 oktober bekend.

Voor teams met contracten, handboeken en gescande dossiers verandert de hardwarekeuze: documenten vooraf indexeren met 9B en zoekvragen lokaal omzetten met 0,6B kan de vraagroute lichter maken. Die combinatie houdt niet automatisch de hele zoekopdracht lokaal. Als de index elders staat, moeten vectoren of resultaten de netwerkgrens over. Volledig lokaal kan ook, met 0,6B aan beide kanten.

Veel vectoren maken details doorzoekbaar

Een standaard embedding vat ieder documentdeel samen in één vector. Dat maakt zoeken snel, maar kan details laten verdwijnen wanneer een pagina meerdere onderwerpen, tabellen of kolommen bevat. Perplexity’s late-interactionmodellen bewaren een vector van 128 dimensies per token. Bij het zoeken kiest elk token in de vraag het best passende token in het document; MaxSim telt die overeenkomsten op.

Daardoor kunnen verschillende delen van een vraag op afzonderlijke passages aansluiten. Een vraag over een contractpartij en opzegtermijn kan bijvoorbeeld beide details terugvinden. De modellen doorzoeken een gerenderde PDF-pagina rechtstreeks als afbeelding. OCR of extractie naar platte tekst is voor die route niet nodig, zodat tabelindeling en visuele relaties behouden blijven.

De extra vergelijking kost opslag en rekentijd. Gewone embeddings bewaren één vector per documentdeel en laten systemen snel zoeken in grote vectorverzamelingen. Late interaction bewaart vectoren per token en vergelijkt bij iedere kandidaat meerdere tokenparen. Perplexity zegt dat de kosten daardoor toenemen met de documentlengte. De techniek zit tussen compacte embeddings en cross-encoders in, die elke vraag samen met ieder document verwerken en vooral geschikt zijn om een kleine eerste selectie opnieuw te rangschikken.

Van context per blok naar vergelijking per token

Perplexity publiceerde op 30 september al een contextueel model dat ieder tekstblok met het hele document in beeld codeert en één vector per blok oplevert. Die aanpak helpt een passage te koppelen aan namen en hoofdstukken elders in een document. De nieuwe release pakt een ander verlies aan: in plaats van een heel blok in één vector te persen, bewaart late interaction de representatie van afzonderlijke tokens.

De twee modelgroottes delen een embeddingruimte. Een team kan documenten met 9B indexeren en zoekvragen met 0,6B omzetten naar vectoren. Perplexity meet voor die combinatie 1,6 procentpunt winst op domeinspecifieke teksttaken, vergeleken met 0,6B aan beide kanten. Voor visuele documentretrieval op ViDoRe v3 stijgt de nDCG@10-score van 62,3 naar 63,5 procent. nDCG@10 meet hoe goed relevante pagina’s in de eerste tien resultaten staan. De extra berekening zit vooral bij het vooraf opbouwen van de index, niet bij iedere nieuwe vraag.

De 0,6B-variant telt 594 miljoen parameters in totaal, waarvan volgens Perplexity ongeveer 240 miljoen actief zijn bij tekstverwerking en 340 miljoen bij beeldverwerking. Het bedrijf ontwierp hem als lichte vraagencoder voor edge-apparaten. De aankondiging noemt geen minimale geheugen- of latency-eis voor een laptop of ander apparaat. Een eigen meting blijft dus nodig om te weten of lokale verwerking op bestaande hardware snel genoeg is.

De modelkaart van 0,6B vermeldt MIT en 62,3 procent op beeldretrieval; de 9B-modelkaart vermeldt dezelfde licentie en 65,2 procent. MIT staat commercieel gebruik toe. Beide modellen werken volgens Perplexity met Sentence Transformers 6.0 of hoger en Transformers 5.4 of hoger. De modelkaarten vragen tekst- en beeldbatches apart te coderen; een gemengde invoer met tekst en afbeeldingen tegelijk wordt niet ondersteund. API-beschikbaarheid volgt volgens Perplexity geleidelijk, zonder genoemde datum. Zelf hosten is de concrete route die nu wordt beschreven.

De PDF-score vraagt om een eigen test

Perplexity’s resultaat is 92,4 procent voor 9B en 90,1 procent voor 0,6B op MADQA. De test gebruikt een agent die 800 PDF’s van samen ruim 18.000 pagina’s doorzoekt om 500 menselijke vragen te beantwoorden. Volgens Perplexity haalt Mixedbread Agentic Search 93,4 procent, binnen de betrouwbaarheidsmarge van Perplexity; dezelfde agent met de gewone Mixedbread-retriever haalt 88,9 procent.

Dit zijn resultaten uit Perplexity’s eigen evaluatie. Het bedrijf licht benchmark, datasets en geteste basismodellen toe. De scores voorspellen niet hoeveel Nederlandse contracten, producthandleidingen of facturen jouw systeem goed vindt. Daarvoor moet de retrievalstap worden getest met vragen waarvan het antwoord en de ondersteunende pagina bekend zijn.

Google kiest voor meer soorten media

Google bracht een dag eerder EmbeddingGemma 2 uit, een multimodaal embeddingmodel van 740 miljoen parameters dat tekst, code, afbeeldingen, video en audio in één vectorruimte zet. Google zegt dat de gekwantiseerde volledige versie circa 567 MB actief geheugen gebruikt op een Pixel 11 Pro. De aanpak bestrijkt meer mediatypen; Perplexity richt deze release op tekst- en beeldretrieval en vergelijkt op tokenniveau. De benchmarks zijn niet rechtstreeks vergelijkbaar, omdat ze andere taken meten.

De lokale zoekdemonstraties van EmbeddingGemma 2 laten zien hoe Google audio en video op een apparaat wil doorzoeken; de cijfers over geheugen en modaliteiten staan in Googles aankondiging. Welke route past, hangt af van het archief: scans met tabellen vragen andere proeven dan een mediabibliotheek met audio en video.

Bij retrieval-augmented generation (RAG) zoekt een systeem eerst bronnen voor het antwoordmodel. Een keten met hybride zoeken, reranking en een eigen evaluatieset zegt daarom meer dan een losse modelscoresheet. Late interaction maakt zwaardere indexering en lichtere vraagverwerking mogelijk. De volledige technische rapportage volgt volgens Perplexity later dit jaar.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Zoek op je eigen kennis

Ik denk met je mee en ontwerp, realiseer en automatiseer een zoekketen rond je eigen documenten, self-hosted waar dat kan. Van eerste idee tot livegang houd ik de hele route in handen.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

Google brengt EmbeddingGemma 2 uit voor lokaal zoeken
Nieuws
5 min

6 okt 22:28

Google brengt EmbeddingGemma 2 uit voor lokaal zoeken

EmbeddingGemma 2 zet tekst, code, beeld, video en audio in één lokale zoekruimte. Google deelt cijfers over geheugen en prestaties, maar de benchmarks zeggen nog niet hoe goed het model zoekt in de eigen bedrijfscollectie.

Perplexity brengt contextueel embeddingmodel uit voor RAG
Nieuws
3 min

1 okt 06:28

Perplexity brengt contextueel embeddingmodel uit voor RAG

Perplexity publiceert een MIT-gelicentieerde preview van contextuele embeddings voor RAG. Het model moet antwoorden en ondersteunende passages samen ophalen, maar de benchmarkcijfers blijven rapportage van Perplexity.

Abacus AI maakt gratis coding-agent open source
Nieuws
4 min

22 sep 00:26

Abacus AI maakt gratis coding-agent open source

Abacus AI brengt een gratis open-source coding-agent uit die lokaal op Windows, Mac en Linux draait. De app geeft ontwikkelteams 2.000 startcredits, eigen modelkeuze en meer dan 100 koppelingen, maar vraagt scherpe datacontrole.

HP levert Perplexity-agent voorgeïnstalleerd op ZBook Ultra G3a
Nieuws
4 min

16 sep 06:16

HP levert Perplexity-agent voorgeïnstalleerd op ZBook Ultra G3a

HP gaat Perplexity Computer voorinstalleren op de ZBook Ultra G3a. De deal koppelt lokale AI, Microsoft 365 en Revit aan de hardwarekeuze, terwijl levering in oktober 2026 en Nederlandse beschikbaarheid nog openstaan.

Google lanceert Gemini 3.5 Transcribe met Nederlands in de API
Nieuws
5 min

27 aug 00:35

Google lanceert Gemini 3.5 Transcribe met Nederlands in de API

Google brengt Gemini 3.5 Transcribe uit, een spraak-naar-tekstmodel dat vulwoorden weghaalt en tekst opmaakt. Nederlands werkt via de API, de consumentenkanalen blijven voorlopig Engels. Kosten: ongeveer 30 dollarcent per uur audio.

Ornith zet modelfamilie 1.5 open, van 9B tot 397B
Nieuws
6 min

20 aug 06:10

Ornith zet modelfamilie 1.5 open, van 9B tot 397B

Ornith zette de gewichten van modelfamilie 1.5 op Hugging Face, van 9 tot 397 miljard parameters onder een MIT-label. Het LICENSE-bestand waarnaar de modelkaarten verwijzen ontbreekt in alle drie de repositories.