Een Nvidia GeForce RTX grafische kaart, het type GPU waarop open-weight AI-modellen draaien.
Nieuws10 juli · 18:234 min leestijd

Ollama haalt 65 miljoen dollar op en lanceert betaalde cloud die per GPU-tijd afrekent

Ollama haalt 65 miljoen dollar op en zet naast de gratis lokale tool een betaalde cloud die per GPU-tijd afrekent. Voor bedrijven die vendor lock-in willen vermijden verschuift dat de rekensom rond zelf-hosten.

Ollama, de populaire tool waarmee je open-weight AI-modellen lokaal draait, haalt 65 miljoen dollar op in een Series B onder leiding van Theory Ventures en zet daarnaast een betaalde cloud neer die per GPU-tijd afrekent. Dat maakte het bedrijf op 9 juli bekend. De ronde brengt het totaal opgehaalde kapitaal op 88 miljoen dollar; Benchmark, 8VC en Y Combinator deden mee.

Voor een Nederlandse ondernemer die AI wil draaien zonder aan één leverancier vast te zitten, was Ollama tot nu toe vooral de gratis lokale achtervang: modellen op je eigen machine, geen maandrekening. Met de nieuwe cloud komt daar een betaald middenpad bij. Je huurt rekenkracht in plaats van een eigen grafische kaart te kopen, en dat verschuift de rekensom rond zelf-hosten precies op het punt waar die het vaakst knelt: de hardware eronder. In een leverancier-onafhankelijke AI-stack draait een open-weight model dat je met Ollama opzet als de achtervang achter een modelrouter, zodat je nooit vastzit aan één API. Die achtervang krijgt nu een cloudvariant.

De cloud rekent per GPU-tijd af, niet per token

De betaalde laag kent drie niveaus. Gratis blijft gratis: de desktop-tool om modellen lokaal te draaien verandert niet, en je mag één cloudmodel tegelijk gebruiken. Voor 20 dollar per maand (of 200 dollar per jaar) draai je drie cloudmodellen tegelijk met naar eigen zeggen vijftig keer meer gebruik; voor 100 dollar per maand worden dat er tien. Een teamversie met centrale facturering, SSO en toegangsbeheer staat aangekondigd.

Het opvallende zit in de meter. Ollama rekent af op werkelijke GPU-tijd in plaats van een tokenlimiet: je verbruik hangt af van de modelgrootte en hoe lang een verzoek de kaart bezet, met gebruikslimieten die elke vijf uur en elke zeven dagen resetten. Het bedrijf belooft daarbij geen logging en geen training op je verkeer, precies de twee zorgen waarom bedrijven open-weight overwegen.

Terminal met het commando ollama run llama3, waarna het lokale model antwoord genereert. Bron: MGeog2022 / Wikimedia Commons (CC BY 4.0)
Terminal met het commando ollama run llama3, waarna het lokale model antwoord genereert. Bron: MGeog2022 / Wikimedia Commons (CC BY 4.0)

Waarom dit de rekensom verschuift

Afrekenen op GPU-tijd is eerlijker dan het klinkt, maar het is ook een spiegel. Het maakt zichtbaar wat zelf-hosten altijd al kostte en wat de "open is gratis"-marketing wegpoetst: de echte rekening van een open-weight model zit niet in de prijs per miljoen tokens maar in de benutting van de GPU eronder. Een eigen kaart die dag en nacht stroom vreet terwijl je hem half benut, is duur; een gedeelde cloud die alleen de bezette seconden rekent, kan voor wisselend gebruik goedkoper uitvallen dan eigen hardware, en tegelijk zwaardere modellen aan dan een laptop trekt.

De tractie eronder is fors. 8,9 miljoen ontwikkelaars gebruiken de tool elke maand en Ollama draait volgens het bedrijf bij 85 procent van de Fortune 500, gebouwd door een team van veertien mensen rond oprichter en CEO Jeff Morgan. Dat is het bewijs dat lokaal draaien geen niche meer is, maar een standaardkeuze in de gereedschapskist.

De stap tekent waar open-weight AI heen beweegt: niet lokaal of cloud, maar een hybride waarin je per taak kiest. Gevoelige of routineuze verwerking blijft binnen je eigen muren, pieken en de zwaarste modellen gaan naar de cloud, zonder dat je aan één modelleverancier vastzit. Het valt op dat dit gebeurt terwijl Meta zijn open Llama-model juist achter slot zette. Wie de regie over zijn AI-stack wil houden, krijgt er met deze cloud een knop bij, maar ook een nieuwe leveranciersrelatie om scherp op de voorwaarden te letten: bij open gewichten zit je nooit vast aan een model, aan een cloud onder het model kun je dat wel raken.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Grip op je eigen AI-stack

Wil je AI draaien zonder aan één leverancier vast te zitten? Ik denk mee, ontwerp en bouw je AI-stack end-to-end, self-hosted waar dat kan, van open-weight modellen tot de koppelingen en automatisering eromheen.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Nvidia, Microsoft en Meta bepleiten open AI-modellen bij Washington
Nieuws
4 min

24 jul 18:21

Nvidia, Microsoft en Meta bepleiten open AI-modellen bij Washington

Voor het eerst zetten de grootste Amerikaanse AI-leveranciers zelf, niet alleen startups, gezamenlijk hun gewicht achter open modellen. In een brief aan Washington vragen Nvidia, Microsoft, Meta en Palantir om geen beperkingen op open-weight AI.

Snap brengt SPECS naar zakelijke werkvloer
Nieuws
4 min

17 sep 04:28

Snap brengt SPECS naar zakelijke werkvloer

Snap positioneert de SPECS AR-bril voor winkels, fabrieken en buitendienst. De aangekondigde koppelingen met Salesforce, AWS en NVIDIA zijn nog in opbouw, terwijl de bril 2.195 dollar kost en shipping voorlopig alleen voor de VS, het VK en Frankrijk gepland staat.

Consumentenbond wil verbod op Meta-camerabril na privacytest
Nieuws
3 min

10 sep 10:24

Consumentenbond wil verbod op Meta-camerabril na privacytest

De Consumentenbond wil een verbod op Meta’s camerabril nadat een sticker het opnamelampje in een nieuwe test nog steeds omzeilt. Voor bedrijven verschuift de privacyvraag naar huisregels voor werkvloer en bezoekers.

Meta lanceert Muse Spark 1.3 met 25 procent minder tokens
Nieuws
5 min

3 sep 00:10

Meta lanceert Muse Spark 1.3 met 25 procent minder tokens

Meta brengt Muse Spark 1.3 uit met volgens eigen metingen 20 procent minder toolaanroepen en 25 procent minder tokens dan versie 1.2, tegen dezelfde prijs. Wat dat scheelt op de rekening van een codeeragent.

Amerikaanse subcommissie stuurt wet door die Chinese open modellen laat doorlichten
Nieuws
4 min

2 sep 06:35

Amerikaanse subcommissie stuurt wet door die Chinese open modellen laat doorlichten

De Open-Source AI Leadership Act passeerde dinsdag de subcommissie Commerce, Manufacturing and Trade. De wet verplicht het Amerikaanse ministerie van Handel tot een openbaar jaarrapport over de risico's van Chinese open modellen.

Nvidia praat over 14 miljard dollar voor Hugging Face, waarvan 1 miljard voor personeelsbehoud
Nieuws
4 min

2 sep 04:09

Nvidia praat over 14 miljard dollar voor Hugging Face, waarvan 1 miljard voor personeelsbehoud

Bloomberg meldt vergevorderde gesprekken over een deal van circa 14 miljard dollar: 12,9 miljard koopsom plus ongeveer 1 miljard om personeel te houden. Getekend is er nog niets.