Een nachtelijke hemel vol sterren als losse lichtpunten, sommige dicht bij elkaar geclusterd.
Uitgelegd10 juli · 11:097 min leestijd

Wat zijn embeddings? Zo wordt betekenis een plek

Zoeken is geen trefwoorden matchen. Een embedding maakt van tekst een punt in een betekenisruimte, waar 'goedkope laptop' en 'betaalbare notebook' naast elkaar liggen zonder een woord te delen. Typ, kies, en zie hoe afstand betekenis wordt.

Wat je leert

Je kunt uitleggen wat een embedding is: hoe een stuk tekst een punt in een betekenisruimte wordt, waarom afstand daar betekenis is, hoe je dat meet met cosine similarity, en waar het model tekortschiet.

Basis ~7 minRetrieval & RAG

Handig vooraf: Wat is een token

Volg de interactieve lesDoe het zelf, stap voor stap, met een kennischeck om te zien of het zit.

Je denkt waarschijnlijk dat een computer zoekt door dezelfde woorden terug te vinden: typ "laptop", krijg pagina's met het woord "laptop". Of net het omgekeerde, dat de AI je zin gewoon begrijpt zoals een mens dat doet. Geen van beide klopt. Wat er echt gebeurt is vreemder en veel bruikbaarder: je tekst wordt een punt op een landkaart, en de afstand tot andere punten is de betekenis.

Kijk eerst wat dat oplevert voor je het een naam geeft. Je zoekt "goedkope laptop voor studenten". Hieronder staan drie documenten. Kies welke het best past, niet op woorden maar op bedoeling.

Zoek op bedoeling: welk document hoort bij deze zoekopdracht?

Je zoekt 'goedkope laptop voor studenten'. Welk document past het best op bedoeling?

Merk je wat er net gebeurde? Het winnende document, "betaalbare notebooks voor school", deelt geen enkel woord met je zoekopdracht. En het document dat het woord "laptop" letterlijk bevat, viel af. Trefwoord-overlap is geen betekenis-overlap.

Dat punt op de kaart heet een embedding. Een embedding is een lijst getallen, een vector, die een stuk tekst omzet in een punt in een ruimte met honderden tot duizenden dimensies. Een embedding-model is zo getraind dat teksten met vergelijkbare betekenis dicht bij elkaar belanden. Afstand in die ruimte staat voor verschil in betekenis, dus een machine zoekt op bedoeling in plaats van op trefwoord.

Het model leest je tekst niet als losse woorden, maar eerst als tokens, de stukjes uit een vaste lijst. Die tokens gaan erin; er komt één vector uit voor het hele stuk tekst. Hoe die vector ontstaat en waar hij tekortschiet, zit in deze drie lagen.

Kies je diepte

Elk stukje tekst krijgt een plek op een gigantische landkaart van betekenis. Wat hetzelfde bedoelt, woont in dezelfde buurt: 'appel', 'peer' en 'banaan' liggen bij elkaar, ver van 'banklening'. Zoeken wordt dan simpel: welke buren liggen het dichtst bij je vraag?

Hoe kan een zin zonder gedeelde woorden toch de beste match zijn?

Hoe dichter twee vectoren bij elkaar liggen, hoe verwanter hun betekenis. De gangbare maat is cosine similarity: de hoek tussen de twee vectoren. Kleine hoek, verwant; grote hoek, onverwant. OpenAI normaliseert zijn embeddings op lengte 1, waardoor die hoek een simpel inwendig product wordt. Zo ligt "appel" naast "peer" en "banaan", en ver van "banklening". En "bank" belandt in een andere buurt afhankelijk van de zin: geld of meubel.

Daarom is dit zo krachtig. Je vindt relevante tekst zonder gedeelde trefwoorden. Synoniemen, parafrases, zelfs een Nederlandse vraag op een Engels document matchen op betekenis. Dit is de motor onder semantisch zoeken, aanbevelingen en clustering, en de kern van RAG: je embed de vraag en haalt de dichtstbijzijnde stukken tekst op, precies wat er gebeurt als je een AI-chatbot op je eigen documenten bouwt.

Richtingen in de ruimte dragen zelfs betekenis. In de klassieke word-embeddings van word2vec en GloVe gold een verrassende rekensom: koning min man plus vrouw ligt het dichtst bij koningin. Richtingen coderen relaties: geslacht, meervoud, tijd. Mooi als intuïtie, maar overschat het niet. Het klopt het schoonst in die vroege modellen; moderne zins-embeddings doen die som lang niet zo netjes.

Waarom meer dimensies niet altijd winnen

Meer assen betekent meer nuance, maar ook meer opslag en rekenwerk, en de winst vlakt af. OpenAI's text-embedding-3-small geeft 1536 getallen, de large 3072. Toch verslaat diezelfde large ingekort tot 256 getallen nog steeds het oudere ada-002 op volle 1536. Het aantal dimensies zegt op zich niets over de kwaliteit.

Dan de belangrijkste grens. Een embedding is een lossy samenvatting van betekenis, gedestilleerd uit trainingsdata. Hij vangt statistische, correlationele betekenis, geen echt begrip, en erft de vooroordelen die in de data zaten: word-embeddings op Google News koppelden 'programmeur' aan man en 'huisvrouw' aan vrouw. Nabijheid is geen waarheid, en niet per se relevantie voor jouw specifieke taak.

Haal het even terug voor je verder gaat.

Snap je embeddings? Drie checks.

Twee zinnen delen geen enkel woord. Kunnen hun embeddings toch dicht bij elkaar liggen?

Betekenis werd plaats, en plaats is te meten. Dat is de hele truc: niet dat de machine je woorden begrijpt, maar dat ze veranderen in een coördinaat waar afstand iets zegt. Zodra je zoeken zo bekijkt, snap je meteen waarom een goed systeem soms feilloos het juiste stuk vindt zonder een gedeeld woord, en soms zelfverzekerd naast zit.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Je eigen kennis doorzoekbaar op bedoeling

Betekenis als plek maakt je eigen documenten doorzoekbaar op bedoeling in plaats van op trefwoord. Ik denk met je mee, ontwerp de aanpak en bouw de semantische zoek- of RAG-laag op je eigen data, van eerste idee tot iets dat live staat.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Jouw leerpad

Elke les staat op zichzelf, maar samen vormen ze een pad. Dit is waar deze les in dat pad zit.

Eerst dit

Hierna

  • Je leert het model niets nieuws. Je geeft het op het juiste moment de juiste pagina’s, zodat het antwoordt vanuit jouw kennis in plaats van te gokken.

    Start de les
  • Wat is GraphRAGsterk verwant

    Gewone RAG vindt losse pagina’s die op je vraag lijken. Een kennisgraaf kent ook de verbanden, zodat het model redeneert over hoe dingen samenhangen, niet alleen wat erop lijkt.

    Start de les

Gerelateerde artikelen

Chinese AI-ontwikkelaars publiceren testresultaten bij 3,6% van modelreleases
Nieuws
5 min

9 okt 16:17

Chinese AI-ontwikkelaars publiceren testresultaten bij 3,6% van modelreleases

Een telling van negen Chinese AI-aanbieders vond bij 31 van 857 releases een gepubliceerde testuitslag per modelversie. Het cijfer gaat over openbare documentatie, niet over alle interne tests.

Drie ex-OpenAI-onderzoekers betwisten ontslagreden
Nieuws
5 min

9 okt 14:17

Drie ex-OpenAI-onderzoekers betwisten ontslagreden

Drie ex-OpenAI-onderzoekers zeggen dat hun werk met externe veiligheidstoetsers binnen hun rol viel. OpenAI bestrijdt dat, ontkent vergelding en belooft contractdetails over onafhankelijke beoordelaars binnen enkele weken.

OpenAI verstoort twee invloedscampagnes met ChatGPT
Nieuws
5 min

9 okt 12:12

OpenAI verstoort twee invloedscampagnes met ChatGPT

OpenAI legt Russische en Iraanse ChatGPT-accounts stil na twee beïnvloedingscampagnes. Eén netwerk gebruikte zeven valse journalistprofielen om bijna honderd artikelen bij online media te plaatsen. OpenAI zegt dat niet alle campagnecontent met ChatGPT is gemaakt.

OpenAI trekt drie wiskundemanuscripten in na tekenfout
Nieuws
5 min

9 okt 02:12

OpenAI trekt drie wiskundemanuscripten in na tekenfout

Een tekenfout maakt de bewijsconstructie in één OpenAI-paper ongeldig en raakt twee afhankelijke manuscripten. De repository meldt daarnaast reparaties in 14 andere papers en bijgewerkte verwijzingen in 13 meer.

Anthropic stelt veiligheidsvoorwaarden aan Claude op machines
Nieuws
4 min

8 okt 22:33

Anthropic stelt veiligheidsvoorwaarden aan Claude op machines

Vanaf 12 november moeten Claude-gebruikers bij risicovolle fysieke toepassingen zorgen voor een operator die kan ingrijpen, apparatuur die veilig blijft bij verbindingsverlies en grenzen die onafhankelijk van het model werken.

ICO meldt privacywijzigingen bij tien AI-ontwikkelaars en opent agentconsultatie
Nieuws
4 min

8 okt 18:16

ICO meldt privacywijzigingen bij tien AI-ontwikkelaars en opent agentconsultatie

De ICO meldt privacywijzigingen bij tien AI-modelbouwers en vraagt tot 20 november bewijs over agentrisico’s. Voor inkopers maakt het rapport zichtbaar welke gegevensvragen leveranciers beantwoorden en waar agentcontrole nog openstaat.