Perplexity lanceert pplx-embed-v2-late, twee late-interactionmodellen die tekst, afbeeldingen en visuele documentpagina’s doorzoeken in uitvoeringen van 0,6B en 9B, maakte Perplexity Research op 7 oktober bekend.
Voor teams met contracten, handboeken en gescande dossiers verandert de hardwarekeuze: documenten vooraf indexeren met 9B en zoekvragen lokaal omzetten met 0,6B kan de vraagroute lichter maken. Die combinatie houdt niet automatisch de hele zoekopdracht lokaal. Als de index elders staat, moeten vectoren of resultaten de netwerkgrens over. Volledig lokaal kan ook, met 0,6B aan beide kanten.
Veel vectoren maken details doorzoekbaar
Een standaard embedding vat ieder documentdeel samen in één vector. Dat maakt zoeken snel, maar kan details laten verdwijnen wanneer een pagina meerdere onderwerpen, tabellen of kolommen bevat. Perplexity’s late-interactionmodellen bewaren een vector van 128 dimensies per token. Bij het zoeken kiest elk token in de vraag het best passende token in het document; MaxSim telt die overeenkomsten op.
Daardoor kunnen verschillende delen van een vraag op afzonderlijke passages aansluiten. Een vraag over een contractpartij en opzegtermijn kan bijvoorbeeld beide details terugvinden. De modellen doorzoeken een gerenderde PDF-pagina rechtstreeks als afbeelding. OCR of extractie naar platte tekst is voor die route niet nodig, zodat tabelindeling en visuele relaties behouden blijven.
De extra vergelijking kost opslag en rekentijd. Gewone embeddings bewaren één vector per documentdeel en laten systemen snel zoeken in grote vectorverzamelingen. Late interaction bewaart vectoren per token en vergelijkt bij iedere kandidaat meerdere tokenparen. Perplexity zegt dat de kosten daardoor toenemen met de documentlengte. De techniek zit tussen compacte embeddings en cross-encoders in, die elke vraag samen met ieder document verwerken en vooral geschikt zijn om een kleine eerste selectie opnieuw te rangschikken.
Van context per blok naar vergelijking per token
Perplexity publiceerde op 30 september al een contextueel model dat ieder tekstblok met het hele document in beeld codeert en één vector per blok oplevert. Die aanpak helpt een passage te koppelen aan namen en hoofdstukken elders in een document. De nieuwe release pakt een ander verlies aan: in plaats van een heel blok in één vector te persen, bewaart late interaction de representatie van afzonderlijke tokens.
De twee modelgroottes delen een embeddingruimte. Een team kan documenten met 9B indexeren en zoekvragen met 0,6B omzetten naar vectoren. Perplexity meet voor die combinatie 1,6 procentpunt winst op domeinspecifieke teksttaken, vergeleken met 0,6B aan beide kanten. Voor visuele documentretrieval op ViDoRe v3 stijgt de nDCG@10-score van 62,3 naar 63,5 procent. nDCG@10 meet hoe goed relevante pagina’s in de eerste tien resultaten staan. De extra berekening zit vooral bij het vooraf opbouwen van de index, niet bij iedere nieuwe vraag.
De 0,6B-variant telt 594 miljoen parameters in totaal, waarvan volgens Perplexity ongeveer 240 miljoen actief zijn bij tekstverwerking en 340 miljoen bij beeldverwerking. Het bedrijf ontwierp hem als lichte vraagencoder voor edge-apparaten. De aankondiging noemt geen minimale geheugen- of latency-eis voor een laptop of ander apparaat. Een eigen meting blijft dus nodig om te weten of lokale verwerking op bestaande hardware snel genoeg is.
De modelkaart van 0,6B vermeldt MIT en 62,3 procent op beeldretrieval; de 9B-modelkaart vermeldt dezelfde licentie en 65,2 procent. MIT staat commercieel gebruik toe. Beide modellen werken volgens Perplexity met Sentence Transformers 6.0 of hoger en Transformers 5.4 of hoger. De modelkaarten vragen tekst- en beeldbatches apart te coderen; een gemengde invoer met tekst en afbeeldingen tegelijk wordt niet ondersteund. API-beschikbaarheid volgt volgens Perplexity geleidelijk, zonder genoemde datum. Zelf hosten is de concrete route die nu wordt beschreven.
De PDF-score vraagt om een eigen test
Perplexity’s resultaat is 92,4 procent voor 9B en 90,1 procent voor 0,6B op MADQA. De test gebruikt een agent die 800 PDF’s van samen ruim 18.000 pagina’s doorzoekt om 500 menselijke vragen te beantwoorden. Volgens Perplexity haalt Mixedbread Agentic Search 93,4 procent, binnen de betrouwbaarheidsmarge van Perplexity; dezelfde agent met de gewone Mixedbread-retriever haalt 88,9 procent.
Dit zijn resultaten uit Perplexity’s eigen evaluatie. Het bedrijf licht benchmark, datasets en geteste basismodellen toe. De scores voorspellen niet hoeveel Nederlandse contracten, producthandleidingen of facturen jouw systeem goed vindt. Daarvoor moet de retrievalstap worden getest met vragen waarvan het antwoord en de ondersteunende pagina bekend zijn.
Google kiest voor meer soorten media
Google bracht een dag eerder EmbeddingGemma 2 uit, een multimodaal embeddingmodel van 740 miljoen parameters dat tekst, code, afbeeldingen, video en audio in één vectorruimte zet. Google zegt dat de gekwantiseerde volledige versie circa 567 MB actief geheugen gebruikt op een Pixel 11 Pro. De aanpak bestrijkt meer mediatypen; Perplexity richt deze release op tekst- en beeldretrieval en vergelijkt op tokenniveau. De benchmarks zijn niet rechtstreeks vergelijkbaar, omdat ze andere taken meten.
De lokale zoekdemonstraties van EmbeddingGemma 2 laten zien hoe Google audio en video op een apparaat wil doorzoeken; de cijfers over geheugen en modaliteiten staan in Googles aankondiging. Welke route past, hangt af van het archief: scans met tabellen vragen andere proeven dan een mediabibliotheek met audio en video.
Bij retrieval-augmented generation (RAG) zoekt een systeem eerst bronnen voor het antwoordmodel. Een keten met hybride zoeken, reranking en een eigen evaluatieset zegt daarom meer dan een losse modelscoresheet. Late interaction maakt zwaardere indexering en lichtere vraagverwerking mogelijk. De volledige technische rapportage volgt volgens Perplexity later dit jaar.
Veelgestelde vragen
Zoek op je eigen kennis
Ik denk met je mee en ontwerp, realiseer en automatiseer een zoekketen rond je eigen documenten, self-hosted waar dat kan. Van eerste idee tot livegang houd ik de hele route in handen.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
