Een laptop met technische schema’s en code op het scherm.
Nieuws1 oktober · 06:283 min leestijd

Perplexity brengt contextueel embeddingmodel uit voor RAG

Perplexity publiceert een MIT-gelicentieerde preview van contextuele embeddings voor RAG. Het model moet antwoorden en ondersteunende passages samen ophalen, maar de benchmarkcijfers blijven rapportage van Perplexity.

Perplexity publiceert op 30 september een contextueel embeddingmodel dat RAG-systemen antwoorden en ondersteunende passages uit lange documenten moet laten ophalen, met previewgewichten die teams zelf kunnen hosten.

Een RAG-assistent haalt eerst passages uit eigen documenten op en laat een taalmodel daarop antwoorden. Voor een Nederlands team met een eigen kennisbank verandert de instap: de gewichten staan onder de MIT-licentie, die commercieel zelf hosten toestaat. Je kunt het model daardoor op je eigen documentcollectie testen zonder een Perplexity-API. Perplexity zegt nog aan die API-versie te werken. Het blijft een preview: toekomstige gewichten kunnen onverenigbaar zijn met eerder gemaakte embeddings.

Context blijft aan het tekstblok hangen

RAG-systemen knippen lange documenten vaak in blokken en zetten elk blok om naar een embedding, een getallenreeks waarmee de zoekindex teksten op betekenis vergelijkt. Los gecodeerd kan een passage de verwijzing missen naar een persoon, definitie of hoofdstukkop die elders in het document staat. Perplexity encodeert de blokken samen met de rest van het document, maar levert nog steeds één embedding per blok op.

De contextcompressor die het model tijdens training als leraar gebruikt, draait volgens Perplexity niet mee bij het ophalen. Het embeddingmodel schrijft zelf geen antwoorden. Het verandert welke passages de rest van de RAG-keten kan vinden.

In een aparte test met 74 MTEB-taken rapporteert Perplexity een gemiddelde nDCG@10-score van 81,0% bij blokken van 64 tokens en 79,9% bij blokken van 512 tokens. Die score meet hoe hoog relevante blokken in de resultatenlijst staan; het verschil is 1,1 procentpunt. Perplexity ziet daarin ruimte om de blokgrootte te kiezen, maar de meting zegt niet hoe het model op een eigen documentcollectie presteert.

De benchmarkcijfers zijn van Perplexity

Perplexity testte het model op context-bench, een benchmark die turbopuffer beheert en privé houdt. De test bevat 2.099 vragen over 38.894 lange documenten in 21 domeinen. Hij meet onder meer of een model bijna identieke documenten uit elkaar houdt, het juiste antwoordfragment vindt en passages terughaalt die het antwoord ondersteunen.

Bij de eerste tien resultaten rapporteert het bedrijf 45,5% antwoordrecall en 40,6% recall van ondersteunend bewijs. De eerste meet of het antwoordfragment wordt opgehaald; de tweede hoeveel ondersteunend bewijs uit het document ook wordt teruggevonden. Dat ligt volgens Perplexity respectievelijk 14,4 en 5,0 procentpunt boven Voyage Context 4. Op de openbare ConTEB-benchmark meldt Perplexity het hoogste gemiddelde, maar niet de hoogste score op elke taak. pplx-embed-context-v1-4B scoort hoger op NarrativeQA; NVIDIA Nemotron-3-8B scoort hoger op COVID-QA.

Perplexity meldt dat het model blind is ingediend. De context-bench blijft privé bij turbopuffer, dus teams kunnen de vergelijking niet met dezelfde vragen herhalen. De openbare ConTEB-resultaten komen eveneens uit Perplexity’s evaluatie.

Opslag en gebruik in de praktijk

Perplexity rapporteert 1 kilobyte per vector voor een embedding van 1.024 dimensies in int8. Op die opslagomvang lag de chunk-retrievalscore volgens het bedrijf iets boven Voyage Context 4, dat 8 kilobyte per vector gebruikte bij 2.048 dimensies in float32. Die cijfers gaan alleen over de vectoren, niet over de rest van de index.

De modelkaart vermeldt 1.024 en 2.048 dimensies, int8-embeddings en een laadinterface op Transformers 5.4.0 of nieuwer. Vragen en documentblokken moeten via aparte codeerroutes worden verwerkt. De verkeerde route verlaagt volgens de modelkaart stilzwijgend de retrievalkwaliteit.

Een RAG-keten die embeddings combineert met hybride zoeken, reranking en een eigen testset meet meer dan de score van één model. Zo wordt zichtbaar of het systeem passages terugvindt waarmee medewerkers een antwoord kunnen controleren. Contextuele embeddings zijn vooral relevant wanneer een systeem het antwoord en de passages erachter samen terugvindt.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Van document naar antwoord

Ik denk mee over je eigen documentassistent, ontwerp het zoeken en de bronvermelding en breng het product van eerste idee tot livegang. Waar het kan, draait het op je eigen infrastructuur.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

Xiaomi maakt MiMo-V2.6 Pro en Flash open source
Nieuws
4 min

22 sep 03:11

Xiaomi maakt MiMo-V2.6 Pro en Flash open source

Xiaomi maakt MiMo-V2.6 Pro en Flash open source met MIT-gelicentieerde modelkaarten, lokale inzet via vLLM en SGLang en een contextvenster van 1 miljoen tokens. Voor ontwikkelteams verschuift de keuze naar kwaliteit, prijs, hardware en beheer.

HP levert Perplexity-agent voorgeïnstalleerd op ZBook Ultra G3a
Nieuws
4 min

16 sep 06:16

HP levert Perplexity-agent voorgeïnstalleerd op ZBook Ultra G3a

HP gaat Perplexity Computer voorinstalleren op de ZBook Ultra G3a. De deal koppelt lokale AI, Microsoft 365 en Revit aan de hardwarekeuze, terwijl levering in oktober 2026 en Nederlandse beschikbaarheid nog openstaan.

Shanghai AI Lab publiceert open gewichten van Atria Dawn
Nieuws
4 min

15 sep 16:35

Shanghai AI Lab publiceert open gewichten van Atria Dawn

Shanghai AI Lab publiceert Atria Dawn Preview, een open-weight onderzoeksagent op een MoE-basis van 744 miljard parameters. De MIT-licentie opent self-hosting, maar 1,51 TB aan gewichten maakt infrastructuur onderdeel van de modelkeuze.

Abacus.AI brengt drie Smaug-modellen uit
Nieuws
4 min

11 sep 18:31

Abacus.AI brengt drie Smaug-modellen uit

Abacus.AI brengt Smaug uit: drie open-weight modellen voor agentische taken, met eigen hosting, uiteenlopende licenties en benchmarkwinsten ten opzichte van hun basis. De release verschuift de modelkeuze naar een combinatie van techniek, kosten en rechten.

Ant Group zet Ling-3.0-flash-Fin open voor financiële workflows
Nieuws
4 min

9 sep 12:41

Ant Group zet Ling-3.0-flash-Fin open voor financiële workflows

Ant Group zet Ling-3.0-flash-Fin open: een financieel model voor onderzoek, waardering, spreadsheets en rapportage. De gewichten staan publiek onder MIT, maar 255 GB aan modelbestanden maakt self-hosting een serieuze infrastructuurkeuze.

IFM geeft zes AI-modellen vrij met trainingscode en pre-trainingsdata
Nieuws
5 min

3 sep 18:36

IFM geeft zes AI-modellen vrij met trainingscode en pre-trainingsdata

Het Abu Dhabi-instituut IFM geeft zes AI-modellen van 0,9 tot 375 miljard parameters vrij met trainingscode en pre-trainingscorpus. Op de modelkaarten wijkt de licentie op een punt af van het persbericht.