Perplexity publiceert op 30 september een contextueel embeddingmodel dat RAG-systemen antwoorden en ondersteunende passages uit lange documenten moet laten ophalen, met previewgewichten die teams zelf kunnen hosten.
Een RAG-assistent haalt eerst passages uit eigen documenten op en laat een taalmodel daarop antwoorden. Voor een Nederlands team met een eigen kennisbank verandert de instap: de gewichten staan onder de MIT-licentie, die commercieel zelf hosten toestaat. Je kunt het model daardoor op je eigen documentcollectie testen zonder een Perplexity-API. Perplexity zegt nog aan die API-versie te werken. Het blijft een preview: toekomstige gewichten kunnen onverenigbaar zijn met eerder gemaakte embeddings.
Context blijft aan het tekstblok hangen
RAG-systemen knippen lange documenten vaak in blokken en zetten elk blok om naar een embedding, een getallenreeks waarmee de zoekindex teksten op betekenis vergelijkt. Los gecodeerd kan een passage de verwijzing missen naar een persoon, definitie of hoofdstukkop die elders in het document staat. Perplexity encodeert de blokken samen met de rest van het document, maar levert nog steeds één embedding per blok op.
De contextcompressor die het model tijdens training als leraar gebruikt, draait volgens Perplexity niet mee bij het ophalen. Het embeddingmodel schrijft zelf geen antwoorden. Het verandert welke passages de rest van de RAG-keten kan vinden.
In een aparte test met 74 MTEB-taken rapporteert Perplexity een gemiddelde nDCG@10-score van 81,0% bij blokken van 64 tokens en 79,9% bij blokken van 512 tokens. Die score meet hoe hoog relevante blokken in de resultatenlijst staan; het verschil is 1,1 procentpunt. Perplexity ziet daarin ruimte om de blokgrootte te kiezen, maar de meting zegt niet hoe het model op een eigen documentcollectie presteert.
De benchmarkcijfers zijn van Perplexity
Perplexity testte het model op context-bench, een benchmark die turbopuffer beheert en privé houdt. De test bevat 2.099 vragen over 38.894 lange documenten in 21 domeinen. Hij meet onder meer of een model bijna identieke documenten uit elkaar houdt, het juiste antwoordfragment vindt en passages terughaalt die het antwoord ondersteunen.
Bij de eerste tien resultaten rapporteert het bedrijf 45,5% antwoordrecall en 40,6% recall van ondersteunend bewijs. De eerste meet of het antwoordfragment wordt opgehaald; de tweede hoeveel ondersteunend bewijs uit het document ook wordt teruggevonden. Dat ligt volgens Perplexity respectievelijk 14,4 en 5,0 procentpunt boven Voyage Context 4. Op de openbare ConTEB-benchmark meldt Perplexity het hoogste gemiddelde, maar niet de hoogste score op elke taak. pplx-embed-context-v1-4B scoort hoger op NarrativeQA; NVIDIA Nemotron-3-8B scoort hoger op COVID-QA.
Perplexity meldt dat het model blind is ingediend. De context-bench blijft privé bij turbopuffer, dus teams kunnen de vergelijking niet met dezelfde vragen herhalen. De openbare ConTEB-resultaten komen eveneens uit Perplexity’s evaluatie.
Opslag en gebruik in de praktijk
Perplexity rapporteert 1 kilobyte per vector voor een embedding van 1.024 dimensies in int8. Op die opslagomvang lag de chunk-retrievalscore volgens het bedrijf iets boven Voyage Context 4, dat 8 kilobyte per vector gebruikte bij 2.048 dimensies in float32. Die cijfers gaan alleen over de vectoren, niet over de rest van de index.
De modelkaart vermeldt 1.024 en 2.048 dimensies, int8-embeddings en een laadinterface op Transformers 5.4.0 of nieuwer. Vragen en documentblokken moeten via aparte codeerroutes worden verwerkt. De verkeerde route verlaagt volgens de modelkaart stilzwijgend de retrievalkwaliteit.
Een RAG-keten die embeddings combineert met hybride zoeken, reranking en een eigen testset meet meer dan de score van één model. Zo wordt zichtbaar of het systeem passages terugvindt waarmee medewerkers een antwoord kunnen controleren. Contextuele embeddings zijn vooral relevant wanneer een systeem het antwoord en de passages erachter samen terugvindt.
Veelgestelde vragen
Van document naar antwoord
Ik denk mee over je eigen documentassistent, ontwerp het zoeken en de bronvermelding en breng het product van eerste idee tot livegang. Waar het kan, draait het op je eigen infrastructuur.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
