Pinterest bouwt met NVIDIA een nieuwe AI-laag voor producten die beeld en taal combineren, meldt het bedrijf, voor onder meer visuele zoekopdrachten, contentbegrip, shopping en veiligheid.
Voor een Nederlandse ondernemer met een webshop, catalogus of beeldrijke kennisbank zit de verandering onder het scherm. Pinterest maakt de infrastructuur voor meerdere AI-functies herbruikbaar, zodat niet elke nieuwe toepassing een eigen modelserver, router en beeldverwerking hoeft te krijgen.

Wat er onder zit
De technische beschrijving maakt de model- en infrastructuurkeuzes publiek. Pinterest bouwt de stack rond Qwen3-VL, eigen PinCLIP-embeddings, Blackwell B200, Dynamo, vLLM en EKS. PinCompute, het interne rekenplatform van Pinterest, draait op clusters in Amazon EKS. Een modelrouter en KV-cacheoffloading via LMCache verwerken de grote, wisselende beeldcontexten.
Een duidelijke producttoepassing van die laag is Pinterest Assistant. De assistent voert meerstapsgesprekken en redeneert over Pins, borden, producten en andere beelden. Dezelfde basis ondersteunt ook multimodale herordening, OCR, contentveiligheid en het maken van signalen voor andere systemen. Het gaat dus om een gedeelde servinglaag, niet om één nieuwe knop in de Pinterest-app.
De cijfers achter de keuze
Pinterest vergelijkt verzoeken met vooraf berekende visuele representaties met verzoeken die telkens ruwe afbeeldingen opnieuw door de beeldencoder sturen. In die test meldt het bedrijf gemiddeld een 85 keer snellere start van de respons en 7,3 keer lagere totale latentie. De technische uitwerking noemt ook een gemiddelde verbetering van 1,1 keer in tokenproductie. In piekmetingen liep de winst op tot 369 keer sneller bij de eerste respons en 44 keer sneller over de hele aanvraag.
De aanpak maakt ook grotere beeldcontext praktisch. Een verzoek met 250 afbeeldingen als PinCLIP-tokens had volgens Pinterest ongeveer dezelfde latentie als een verzoek met tien ruwe afbeeldingen. Dat is 25 keer meer visuele context in een vergelijkbare responstijd. Pinterest koppelt die infrastructuur aan meer dan 80 miljard zoekopdrachten per maand en gebruikt die signalen voor AI-gestuurde ontdekking en shopping, zo meldt TheFly.
Waar de complexiteit zit
Een multimodale aanvraag bestaat bij Pinterest uit tekst en afbeeldingen, soms als URL, soms als gecodeerde data en soms als vooraf berekende embeddings. In de technische beschrijving staat dat één verzoek duizenden afbeeldingen kan bevatten. De servinglaag moet die beelden ophalen, verkleinen en normaliseren voordat het model ze kan gebruiken.
Daarom splitst Pinterest de encoder, de voorbereiding van de prompt en het genereren van tokens over aparte stappen. KV-aware routering en opslag buiten het GPU-geheugen helpen voorkomen dat elke beurt dezelfde visuele context opnieuw verwerkt. Pinterest gebruikt voor de metingen ook realistische meerstapsgesprekken, verschillende verzoeksnelheden en agentwerkstromen in plaats van alleen een losse modelaanroep.
Wat dit verandert voor bedrijven
Voor een kleiner team is dit geen belofte dat elke AI-functie 85 keer sneller wordt. Het laat zien welke problemen ontstaan zodra een toepassing veel afbeeldingen, lange gesprekken en meerdere modelstappen tegelijk verwerkt: beeld ophalen en voorbewerken, de vision-encoder draaien, de juiste GPU kiezen en de cache tussen beurten behouden.
De Pinterest-oplossing maakt daar één herbruikbaar platform van. Voor bedrijven met een beeldrijke toepassing verschuift de technische vraag daarmee van alleen welk model goed genoeg is naar hoe visuele representaties, routering, geheugen en evaluatie samen worden ontworpen. De modelkeuze blijft belangrijk, maar bepaalt de productervaring niet meer alleen.
Multimodale AI begint in productie dus niet bij een extra invoerveld voor afbeeldingen. De echte verschuiving zit in de laag die beeldcontext vooraf representeert, routeert en opnieuw gebruikt. Dat patroon raakt webshops, zoekfuncties en kennisbanken zodra beeld een volwaardig onderdeel van het werk wordt.
Veelgestelde vragen
Van AI-idee naar product
Ik denk mee over de AI-laag onder je product, ontwerp de gebruikerservaring en realiseer het geheel van modelkoppeling tot automatisering. Waar het kan houd ik data en infrastructuur self-hosted, zodat je niet alleen een demo hebt maar een werkend systeem.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
