Close-up van een GeForce RTX-videokaart die in een computerbehuizing is gemonteerd
Nieuws25 augustus · 16:115 min leestijd

Perplexity draait zijn AI-agent lokaal op Nvidia-hardware zonder tokenkosten

Perplexity lanceert Portable Computer, een agent die op je eigen Nvidia-machine draait. Lokaal werk kost geen credits, de cloud komt er alleen aan te pas als je daar per stap toestemming voor geeft.

Perplexity lanceert Portable Computer, een versie van zijn agent die het model op je eigen Nvidia-machine draait en pas na jouw toestemming een losse stap naar een cloudmodel stuurt.

Voor een Nederlands team dat bedrijfsbestanden liever niet naar een API stuurt, verandert daarmee de aard van de rekening. Tot nu toe was de keuze een cloudagent met een tokenmeter die meeloopt, of zelf een open model draaien en alle onderdelen eromheen aan elkaar knopen. Portable Computer levert die hele stapel als een installatie, en wat er lokaal afgaat kost geen credits. De prijs staat in de hardware-eis, en die haalt een gewone kantoorlaptop niet.

Wat er op je eigen machine draait

Portable Computer bundelt het model, de inference-engine, het agentgereedschap, de koppelingen naar externe apps en een afgeschermde sandbox waarin de agent code uitvoert. Dat samenstellen is normaal het lastige deel. Een open model downloaden kan iedereen. Er een agent van maken die met bestanden werkt, gereedschap aanroept en een taak van tien stappen afmaakt, vraagt om een inference-engine, een agent-harnas, een sandbox en connectoren die je zelf moet laten samenwerken.

Bij de start kies je tussen Qwen 3.8 27B en PPLX 27B, de door Perplexity nagetrainde versie van datzelfde model. Nvidia's Nemotron 3.5 Lightning volgt, en je mag ook je eigen model met je eigen inference-server meebrengen. De agent leest bestanden en pdf-documenten op je schijf, voert shell-opdrachten uit, neemt dictaat, zoekt op het web en koppelt aan Google Drive, Gmail, Slack en GitHub.

De Nvidia DGX Spark naast een laptop met het installatiescherm van het apparaat. Bron: Nvidia
De Nvidia DGX Spark naast een laptop met het installatiescherm van het apparaat. Bron: Nvidia

Wanneer de cloud alsnog aan zet komt

Elke taak begint op je machine. Stuit het lokale model op een stap die zwaardere redenering vraagt, dan vraagt de agent toestemming voordat die ene stap naar een frontier-model in de cloud gaat, waarna het antwoord terugkomt in de lokale werkstroom. Je hoeft dus geen privacymodus te kiezen of routeringsregels te schrijven: het systeem beslist tijdens het werk en jij tekent per keer. Perplexity zegt dat er voor elke escalatie een PII-classifier over de uitgaande context loopt, die je precies laat zien wat het apparaat zou verlaten. Alleen dat cloud-deel telt mee in je verbruik.

Dat is een wezenlijk andere belofte dan die van vorige maand. In juli bracht Perplexity dezelfde agentlaag naar Windows, voor Max- en Enterprise Max-klanten op abonnementen vanaf 200 dollar per maand, en toen sloeg lokaal op toegang tot je machine en niet op verwerking. De opzet was hybride, met lokale uitvoering naast de cloud van Perplexity, en welke bestandsinhoud het apparaat verliet bleef onduidelijk. Portable Computer zet het model zelf op je hardware en maakt de cloud de uitzondering waarvoor je per stap tekent.

De rekensom verschuift van verbruik naar ijzer

Perplexity zette die afweging in eigen tests op scherp. Op de codeerbenchmark Terminal Bench 2.1 haalt het lokale Qwen-model 59,6 procent tegen nul marginale kosten per taak. Laat je de moeilijke stappen doorschieten naar Claude Opus 5, dan stijgt de score naar 73,0 procent bij 0,415 dollar per taak, tegenover 0,65 dollar voor Claude Opus 5 alleen op 82,4 procent. Het zijn cijfers van de leverancier zelf, dus lees ze als richting en niet als onafhankelijke meting.

Kosten per taak op Terminal Bench 2.1, in dollar (bron: VentureBeat)

Op Perplexity's eigen Local Knowledge Work Bench, 53 taken rond research, financiële analyse en documenten, scoort de opzet met Qwen 82,6 procent en met PPLX 27B 85,4 procent, tegen 77,6 procent voor het open harnas Pi en 74,0 procent voor Hermes. Op de webresearch-benchmark BrowseComp komt het uit op 66,7 procent tegen 50,2 en 43,9 procent, met 70 procent minder tokens.

Nul per taak is alleen niet hetzelfde als nul per maand. Daar kantelt de rekensom, want bij lage benutting kost zelf hosten al snel 30 tot 40 dollar per miljoen tokens terwijl een API dezelfde tokens voor centen levert. Wat Portable Computer aan die som verandert is de teller, niet de noemer. Draait de agent op een kaart die er toch al staat voor ander werk, dan is nul ook echt nul. Koop je hardware speciaal hiervoor, dan koop je capaciteit die je daarna vol moet zien te krijgen.

Waar het meteen scheelt, is bij het type werk dat de rekening opjaagt. Een agent die in een lus draait stuurt bij elke beurt zijn volledige context opnieuw mee, waardoor een proef van een paar euro per dag in productie honderden euro's per week kan verstoken. Precies die herhaling is op eigen hardware gratis.

Wat het ijzer kost

Portable Computer start op Linux en vraagt een Nvidia DGX Spark of een andere Linux-machine met een RTX-GPU van minstens 24 GB VRAM, een RTX 3090 of nieuwer, draaiend op DGX OS of Ubuntu op ARM of x64. Windows volgt in september 2026, macOS staat niet aangekondigd. RTX-kaarten met 24 GB VRAM kosten minstens 1.500 dollar, en dat is de goedkoopste ingang. De DGX Spark zelf heeft volgens Nvidia 128 GB gedeeld geheugen en tot 1 petaflop aan FP4-rekenkracht en draait modellen tot 200 miljard parameters lokaal.

Een aparte prijs is er niet: Portable Computer zit in de abonnementen Pro, Max, Enterprise Pro en Enterprise Max. Dat is een niveau lager dan waar de Windows-uitrol van Personal Computer in juli begon, dus de software vormt de drempel niet. Het ijzer doet dat wel.

Waar dit heen wijst

Nvidia staat aan twee kanten van deze lancering. Het levert de hardware waarop Portable Computer draait, en het onderhandelt over een investering in Perplexity bij een waardering boven 30 miljard dollar. Een agent die alleen op RTX- en DGX-machines start is voor de chipmaker geen bijproduct, maar afzet.

Voor organisaties verandert daarmee de vraag die op tafel ligt. Bij een cloudagent gaat het gesprek over wat een leverancier belooft met je data te doen, vastgelegd in een verwerkersovereenkomst die je moet vertrouwen. Bij een model dat op je eigen machine draait gaat het over wat het apparaat überhaupt verlaat, en dat kun je zien en tegenhouden voordat het gebeurt. De hardware-eis houdt die keuze voorlopig bij bedrijven die zulke machines al hebben staan. Maar de plek waar het model draait is daarmee weer een ontwerpbeslissing geworden in plaats van een gegeven.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

AI op je eigen machine

Wil je AI inzetten zonder dat bedrijfsbestanden naar een API vertrekken, dan denk ik met je mee over de opzet, ontwerp ik het proces eromheen en bouw en automatiseer ik het, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Nvidia wil met de Poolside-licentie een open-weight topmodel bouwen
Nieuws
5 min

23 aug 06:07

Nvidia wil met de Poolside-licentie een open-weight topmodel bouwen

Nvidia wil de licentiedeal van 6 miljard dollar met Poolside gebruiken om een van 's werelds krachtigste open-weight modellen te bouwen, meldt The Wall Street Journal. Wat dat verandert voor teams die nu op Chinese gewichten zelf hosten.

Zoom dicht drie lekken waarmee een deelnemer je apparaat kon overnemen
Nieuws
4

13 aug 06:31

Zoom dicht drie lekken waarmee een deelnemer je apparaat kon overnemen

Zoom repareerde drie lekken in het tekengereedschap bij schermdelen waarmee een deelnemer zonder klik code kon uitvoeren op andermans machine. De patch ligt er sinds eind juni, maar Zoom laat veel oudere clients gewoon meevergaderen.

Nvidia geeft agentmodel Nemotron 3.5 Lightning vrij met een modelrouter erbij
Nieuws
5 min

11 aug 16:10

Nvidia geeft agentmodel Nemotron 3.5 Lightning vrij met een modelrouter erbij

Nvidia publiceert de gewichten van agentmodel Nemotron 3.5 Lightning onder OpenMDW-1.1, een licentie zonder gebruiksbeperkingen, en levert er een routeerlaag bij die in LangChains test 74 procent van de kosten wegneemt.

Alibaba zet de gewichten van Qwen3.8-Max volgende week open
Nieuws
5 min

3 aug 06:12

Alibaba zet de gewichten van Qwen3.8-Max volgende week open

Alibaba maakt Qwen3.8-Max wereldwijd beschikbaar en zet de gewichten volgende week open, samen met een kleinere 27B-versie. Het gehoste model kost 2 dollar per miljoen invoertokens, ruim onder Claude Opus 5.

OpenWorker maakt ook de agent-laag open. Je lock-in verhuist alleen een verdieping omhoog.
Inzicht
6 min

24 jul 13:00

OpenWorker maakt ook de agent-laag open. Je lock-in verhuist alleen een verdieping omhoog.

Andrew Ng bracht OpenWorker uit: een open, lokaal draaiende AI-collega. Klinkt als het einde van vendor lock-in. Maar open source op de agent-laag maakt je niet vrij, het verschuift je afhankelijkheid een verdieping omhoog.

Nvidia haalt 100 procent op ARC-AGI-3 met een eigen agentharnas
Nieuws
5 min

21 aug 22:22

Nvidia haalt 100 procent op ARC-AGI-3 met een eigen agentharnas

Nvidia brengt Claude Opus 5 met onderzoeksharnas AVO op 100,00 op de publieke set van ARC-AGI-3, waar hetzelfde model los rond 30 procent blijft. Het harnas leunt op blijvend geheugen en een supervisor.