Netwerkapparatuur met blauwe kabels in een serverruimte
Nieuws14 september · 18:555 min leestijd

Pinterest bouwt multimodale AI-laag met NVIDIA

Pinterest bouwt met NVIDIA een gedeelde AI-laag voor visuele zoekopdrachten, Pinterest Assistant en veiligheid. De keuze voor Blackwell, Dynamo, vLLM en eigen embeddings laat zien waar multimodale AI in productie op draait.

Pinterest bouwt met NVIDIA een nieuwe AI-laag voor producten die beeld en taal combineren, meldt het bedrijf, voor onder meer visuele zoekopdrachten, contentbegrip, shopping en veiligheid.

Voor een Nederlandse ondernemer met een webshop, catalogus of beeldrijke kennisbank zit de verandering onder het scherm. Pinterest maakt de infrastructuur voor meerdere AI-functies herbruikbaar, zodat niet elke nieuwe toepassing een eigen modelserver, router en beeldverwerking hoeft te krijgen.

Pinterest- en NVIDIA-logo’s naast elkaar op een groene achtergrond, officiële afbeelding: Pinterest
Pinterest- en NVIDIA-logo’s naast elkaar op een groene achtergrond, officiële afbeelding: Pinterest

Wat er onder zit

De technische beschrijving maakt de model- en infrastructuurkeuzes publiek. Pinterest bouwt de stack rond Qwen3-VL, eigen PinCLIP-embeddings, Blackwell B200, Dynamo, vLLM en EKS. PinCompute, het interne rekenplatform van Pinterest, draait op clusters in Amazon EKS. Een modelrouter en KV-cacheoffloading via LMCache verwerken de grote, wisselende beeldcontexten.

Een duidelijke producttoepassing van die laag is Pinterest Assistant. De assistent voert meerstapsgesprekken en redeneert over Pins, borden, producten en andere beelden. Dezelfde basis ondersteunt ook multimodale herordening, OCR, contentveiligheid en het maken van signalen voor andere systemen. Het gaat dus om een gedeelde servinglaag, niet om één nieuwe knop in de Pinterest-app.

De cijfers achter de keuze

Pinterest vergelijkt verzoeken met vooraf berekende visuele representaties met verzoeken die telkens ruwe afbeeldingen opnieuw door de beeldencoder sturen. In die test meldt het bedrijf gemiddeld een 85 keer snellere start van de respons en 7,3 keer lagere totale latentie. De technische uitwerking noemt ook een gemiddelde verbetering van 1,1 keer in tokenproductie. In piekmetingen liep de winst op tot 369 keer sneller bij de eerste respons en 44 keer sneller over de hele aanvraag.

De aanpak maakt ook grotere beeldcontext praktisch. Een verzoek met 250 afbeeldingen als PinCLIP-tokens had volgens Pinterest ongeveer dezelfde latentie als een verzoek met tien ruwe afbeeldingen. Dat is 25 keer meer visuele context in een vergelijkbare responstijd. Pinterest koppelt die infrastructuur aan meer dan 80 miljard zoekopdrachten per maand en gebruikt die signalen voor AI-gestuurde ontdekking en shopping, zo meldt TheFly.

Waar de complexiteit zit

Een multimodale aanvraag bestaat bij Pinterest uit tekst en afbeeldingen, soms als URL, soms als gecodeerde data en soms als vooraf berekende embeddings. In de technische beschrijving staat dat één verzoek duizenden afbeeldingen kan bevatten. De servinglaag moet die beelden ophalen, verkleinen en normaliseren voordat het model ze kan gebruiken.

Daarom splitst Pinterest de encoder, de voorbereiding van de prompt en het genereren van tokens over aparte stappen. KV-aware routering en opslag buiten het GPU-geheugen helpen voorkomen dat elke beurt dezelfde visuele context opnieuw verwerkt. Pinterest gebruikt voor de metingen ook realistische meerstapsgesprekken, verschillende verzoeksnelheden en agentwerkstromen in plaats van alleen een losse modelaanroep.

Wat dit verandert voor bedrijven

Voor een kleiner team is dit geen belofte dat elke AI-functie 85 keer sneller wordt. Het laat zien welke problemen ontstaan zodra een toepassing veel afbeeldingen, lange gesprekken en meerdere modelstappen tegelijk verwerkt: beeld ophalen en voorbewerken, de vision-encoder draaien, de juiste GPU kiezen en de cache tussen beurten behouden.

De Pinterest-oplossing maakt daar één herbruikbaar platform van. Voor bedrijven met een beeldrijke toepassing verschuift de technische vraag daarmee van alleen welk model goed genoeg is naar hoe visuele representaties, routering, geheugen en evaluatie samen worden ontworpen. De modelkeuze blijft belangrijk, maar bepaalt de productervaring niet meer alleen.

Multimodale AI begint in productie dus niet bij een extra invoerveld voor afbeeldingen. De echte verschuiving zit in de laag die beeldcontext vooraf representeert, routeert en opnieuw gebruikt. Dat patroon raakt webshops, zoekfuncties en kennisbanken zodra beeld een volwaardig onderdeel van het werk wordt.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Van AI-idee naar product

Ik denk mee over de AI-laag onder je product, ontwerp de gebruikerservaring en realiseer het geheel van modelkoppeling tot automatisering. Waar het kan houd ik data en infrastructuur self-hosted, zodat je niet alleen een demo hebt maar een werkend systeem.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

Kimi K3 draait op 20.000 gehuurde Nvidia-chips van Alibaba
Nieuws
4 min

31 jul 16:38

Kimi K3 draait op 20.000 gehuurde Nvidia-chips van Alibaba

Moonshot draait Kimi K3 op ongeveer 20.000 Nvidia-chips die het huurt via Alibaba, meldt Bloomberg. De rekenkracht achter het goedkope open model is geleend, bij een partij die tegelijk aandeelhouder en concurrent is.

Nvidia H100-huurprijs stijgt 22 procent in een maand
Nieuws
3 min

8 sep 11:31

Nvidia H100-huurprijs stijgt 22 procent in een maand

De Nvidia H100 is bijna vier jaar oud, maar de huurprijs stijgt. Ornn ziet in zijn marktindex een maandgroei van ongeveer 19 tot 22 procent. Daardoor levert terugvallen naar oudere GPU's niet vanzelf een lagere AI-rekening op.

DeepSeek wil 160.000 Huawei-chips in zijn nieuwe datacenter zetten
Nieuws
4

4 sep 12:12

DeepSeek wil 160.000 Huawei-chips in zijn nieuwe datacenter zetten

DeepSeek wil minstens 160.000 Huawei Ascend 950DT-chips in zijn gigawattdatacenter in Binnen-Mongolië zetten, meldt Bloomberg. De chip is pas eind 2026 leverbaar en het uitleveren van de order kan meer dan een jaar duren.

IFM geeft zes AI-modellen vrij met trainingscode en pre-trainingsdata
Nieuws
5 min

3 sep 18:36

IFM geeft zes AI-modellen vrij met trainingscode en pre-trainingsdata

Het Abu Dhabi-instituut IFM geeft zes AI-modellen van 0,9 tot 375 miljard parameters vrij met trainingscode en pre-trainingscorpus. Op de modelkaarten wijkt de licentie op een punt af van het persbericht.

Equinix kondigt inferentiedienst voor open modellen aan met Nvidia en Together AI
Nieuws
4 min

3 sep 02:21

Equinix kondigt inferentiedienst voor open modellen aan met Nvidia en Together AI

Equinix brengt open AI-modellen naar zijn eigen datacenters, samen met Nvidia en Together AI. De dienst komt in het eerste kwartaal van 2027, maar welke metro's als eerste aangaan is nog niet bekend.

Broadcom lanceert VMware Private AI Cloud met meer dan 150 modellen op eigen infrastructuur
Nieuws
6 min

31 aug 16:47

Broadcom lanceert VMware Private AI Cloud met meer dan 150 modellen op eigen infrastructuur

Broadcom bundelt AI-inferentie, agents en klassieke workloads op VMware Cloud Foundation en valideert vijf modellen voor eigen datacenters. AgentMinder is er nu, de AI Gateway en de agentbeveiliging volgen later.