Nvidia lanceert PAIR, een gratis en open source router die pc's, workstations en Macs op hetzelfde netwerk tot een gedeelde inferentiepool koppelt, zodat lokale AI-agents hun taken over meerdere machines tegelijk verdelen.
Voor een Nederlands team dat met agents werkt, verschuift daarmee de rekensom. Wie elke stap van een agent langs een cloud-API stuurt, betaalt per token en laat de context het pand uit gaan. PAIR laat diezelfde agent draaien op de machines die er toch al staan: de gaming-pc van een ontwikkelaar, een DGX Spark onder het bureau, een MacBook die na vijven niets meer doet. De kosten zitten dan in stroom en in hardware die vaak al is afgeschreven, en prompts en documenten blijven op het eigen netwerk. De software staat sinds 3 september in beta.
Een routeerlaag, geen grotere GPU
PAIR is geen nieuwe inference-engine en geen apparaat. Het is software die machines op het lokale netwerk opspoort via mDNS, ze koppelt nadat je aan beide kanten een zescijferige code bevestigt, en het verkeer daarna over mTLS versleutelt. Vervolgens neemt PAIR de standaardpoort van Ollama of LM Studio over en biedt het zowel een Ollama-compatibel als een OpenAI-compatibel eindpunt aan. Je agent blijft naar hetzelfde adres praten. Alleen komt het antwoord nu van de machine die op dat moment ruimte heeft.
Wat het uitdrukkelijk niet doet, staat in de eigen documentatie. PAIR bundelt geen GPU-geheugen, voegt geen kaarten samen tot een grotere GPU en knipt geen model of lopend verzoek in stukken. Elk verzoek draait van begin tot eind op een node, en die node moet het gevraagde model al hebben staan. Een model dat op geen enkele machine past, past ook met PAIR nergens. Wat je wint is gelijktijdigheid: vijf subagenten die naast elkaar werken in plaats van in de rij op een GPU.

Wat de eigen demo laat zien
Nvidia liet een werkstroom met vijf subagenten los op Qwen 3.6 35B A3B. Op een enkele RTX Spark-laptop duurde die gemiddeld 18 minuten. Op een cluster van drie apparaten, dezelfde laptop plus een DGX Spark en een RTX 5090, was het gemiddeld 8 minuten en 48 seconden. Nvidia zet er zelf bij dat dit een niet-officiële, configuratie-specifieke demonstratie is en geen belofte van lineaire schaling.
De winst hangt volledig af van de vorm van het werk. Taken die strikt op elkaar volgen, of een werkstroom die uit een enkele lange modelaanroep bestaat, schieten er weinig mee op. Hetzelfde geldt als maar een machine het gevraagde model heeft: dan komt alles daar toch terecht.
Productmanager Seth Schneider rekende in een persbriefing een uiterst gunstig huishouden voor met een RTX Spark-laptop, een DGX Spark, een RTX 5090-laptop, een gaming-desktop en een MacBook Pro, samen ongeveer 165 teraflops die niets doen. Dat is een schatkamer aan gratis tokens die vandaag gewoon in huizen staat, zei hij. Realistischer, voegde hij eraan toe, is een gebruiker met een laptop en een gaming-pc. Voor een klein bureau of ontwikkelteam is dat precies de maat: twee tot vier machines die overdag half stilstaan.
Wat de beta nog niet aankan
De randen zijn scherper dan de aankondiging suggereert. De planner rangschikt nodes puur op hoeveel werk er al in de wachtrij staat en kijkt niet naar GPU-type, vrij geheugen, benutting, latency of de vraag of het model al geladen is. Op een gemengd machinepark landt werk dus net zo vaak op de trage node als op de snelle. Nvidia noemt dat zelf een gat en zet verbetering op de routekaart.
PAIR werkt alleen met Ollama en LM Studio als engine, en of een engine op een machine draait is een zaak tussen die engine en die machine. De Linux-installer is alleen een deb-pakket, Windows op ARM is experimenteel, en macOS kan na langere tijd zonder cluster stoppen met het beantwoorden van verbindingen van andere machines, waarna een herstart het oplost. Ook detecteert PAIR geen vastgelopen achtergronddienst: die blijft draaien terwijl de status stilletjes niet meer bijwerkt.
De instapeisen zijn laag. Ondersteund zijn GeForce RTX-kaarten uit de 20-serie en nieuwer, RTX PRO-werkstationkaarten, DGX Spark en Apple-silicon vanaf M4, op Windows 11, Linux en macOS, met minimaal 8 GB werkgeheugen en zo'n 20 GB schijfruimte. De code staat onder Apache 2.0 op GitHub, waar ook de installers voor de drie platforms liggen.
Waar dit heen wijst
PAIR was niet de enige aankondiging in Berlijn. Nvidia kondigde tegelijk aan dat drie agent-apps een vereenvoudigde lokale installatie op Windows krijgen: Hermes Agent, OpenClaw en Perplexity's Portable Computer, dat het model op je eigen Nvidia-machine draait en pas na expliciete toestemming een losse stap naar een cloudmodel stuurt. Het patroon is duidelijk: Nvidia verkoopt hier geen nieuwe doos, maar haalt wrijving weg bij hardware die al verkocht is.
Routeren als kostenknop is intussen aan beide kanten van de lijn te zien. In augustus kwam Router.com, dat elk verzoek naar het goedkoopste cloudmodel stuurt dat de taak nog aankan en voorlopig alleen in de Verenigde Staten te koop is. PAIR draait diezelfde knop de andere kant op en stuurt het verzoek naar de goedkoopste machine die je al bezit. Voor wie agents draait, verschuift de vraag daarmee van welk API-abonnement past bij dit volume naar welke machines hier tussen negen en vijf staan te niksen.
Veelgestelde vragen
Agents op je eigen machines
Lokale inferentie is pas winst als de agent, de koppelingen en het beheer eromheen kloppen. Ik denk mee over wat je zelf wilt draaien, ontwerp de opzet en bouw en automatiseer hem end to end, self hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
