Een Nvidia GeForce RTX grafische kaart, het type GPU waarop open-weight AI-modellen draaien.
Nieuws10 juli · 18:234 min leestijd

Ollama haalt 65 miljoen dollar op en lanceert betaalde cloud die per GPU-tijd afrekent

Ollama haalt 65 miljoen dollar op en zet naast de gratis lokale tool een betaalde cloud die per GPU-tijd afrekent. Voor bedrijven die vendor lock-in willen vermijden verschuift dat de rekensom rond zelf-hosten.

Ollama, de populaire tool waarmee je open-weight AI-modellen lokaal draait, haalt 65 miljoen dollar op in een Series B onder leiding van Theory Ventures en zet daarnaast een betaalde cloud neer die per GPU-tijd afrekent. Dat maakte het bedrijf op 9 juli bekend. De ronde brengt het totaal opgehaalde kapitaal op 88 miljoen dollar; Benchmark, 8VC en Y Combinator deden mee.

Voor een Nederlandse ondernemer die AI wil draaien zonder aan één leverancier vast te zitten, was Ollama tot nu toe vooral de gratis lokale achtervang: modellen op je eigen machine, geen maandrekening. Met de nieuwe cloud komt daar een betaald middenpad bij. Je huurt rekenkracht in plaats van een eigen grafische kaart te kopen, en dat verschuift de rekensom rond zelf-hosten precies op het punt waar die het vaakst knelt: de hardware eronder. In een leverancier-onafhankelijke AI-stack draait een open-weight model dat je met Ollama opzet als de achtervang achter een modelrouter, zodat je nooit vastzit aan één API. Die achtervang krijgt nu een cloudvariant.

De cloud rekent per GPU-tijd af, niet per token

De betaalde laag kent drie niveaus. Gratis blijft gratis: de desktop-tool om modellen lokaal te draaien verandert niet, en je mag één cloudmodel tegelijk gebruiken. Voor 20 dollar per maand (of 200 dollar per jaar) draai je drie cloudmodellen tegelijk met naar eigen zeggen vijftig keer meer gebruik; voor 100 dollar per maand worden dat er tien. Een teamversie met centrale facturering, SSO en toegangsbeheer staat aangekondigd.

Het opvallende zit in de meter. Ollama rekent af op werkelijke GPU-tijd in plaats van een tokenlimiet: je verbruik hangt af van de modelgrootte en hoe lang een verzoek de kaart bezet, met gebruikslimieten die elke vijf uur en elke zeven dagen resetten. Het bedrijf belooft daarbij geen logging en geen training op je verkeer, precies de twee zorgen waarom bedrijven open-weight overwegen.

Terminal met het commando ollama run llama3, waarna het lokale model antwoord genereert. Bron: MGeog2022 / Wikimedia Commons (CC BY 4.0)
Terminal met het commando ollama run llama3, waarna het lokale model antwoord genereert. Bron: MGeog2022 / Wikimedia Commons (CC BY 4.0)

Waarom dit de rekensom verschuift

Afrekenen op GPU-tijd is eerlijker dan het klinkt, maar het is ook een spiegel. Het maakt zichtbaar wat zelf-hosten altijd al kostte en wat de "open is gratis"-marketing wegpoetst: de echte rekening van een open-weight model zit niet in de prijs per miljoen tokens maar in de benutting van de GPU eronder. Een eigen kaart die dag en nacht stroom vreet terwijl je hem half benut, is duur; een gedeelde cloud die alleen de bezette seconden rekent, kan voor wisselend gebruik goedkoper uitvallen dan eigen hardware, en tegelijk zwaardere modellen aan dan een laptop trekt.

De tractie eronder is fors. 8,9 miljoen ontwikkelaars gebruiken de tool elke maand en Ollama draait volgens het bedrijf bij 85 procent van de Fortune 500, gebouwd door een team van veertien mensen rond oprichter en CEO Jeff Morgan. Dat is het bewijs dat lokaal draaien geen niche meer is, maar een standaardkeuze in de gereedschapskist.

De stap tekent waar open-weight AI heen beweegt: niet lokaal of cloud, maar een hybride waarin je per taak kiest. Gevoelige of routineuze verwerking blijft binnen je eigen muren, pieken en de zwaarste modellen gaan naar de cloud, zonder dat je aan één modelleverancier vastzit. Het valt op dat dit gebeurt terwijl Meta zijn open Llama-model juist achter slot zette. Wie de regie over zijn AI-stack wil houden, krijgt er met deze cloud een knop bij, maar ook een nieuwe leveranciersrelatie om scherp op de voorwaarden te letten: bij open gewichten zit je nooit vast aan een model, aan een cloud onder het model kun je dat wel raken.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Grip op je eigen AI-stack

Wil je AI draaien zonder aan één leverancier vast te zitten? Ik denk mee, ontwerp en bouw je AI-stack end-to-end, self-hosted waar dat kan, van open-weight modellen tot de koppelingen en automatisering eromheen.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Nvidia, Microsoft en Meta bepleiten open AI-modellen bij Washington
Nieuws
4 min

24 jul 18:21

Nvidia, Microsoft en Meta bepleiten open AI-modellen bij Washington

Voor het eerst zetten de grootste Amerikaanse AI-leveranciers zelf, niet alleen startups, gezamenlijk hun gewicht achter open modellen. In een brief aan Washington vragen Nvidia, Microsoft, Meta en Palantir om geen beperkingen op open-weight AI.

Alibaba verkoopt voor 10,2 miljard dollar aandelen om zijn AI-stack te betalen
Nieuws
3

23 aug 12:10

Alibaba verkoopt voor 10,2 miljard dollar aandelen om zijn AI-stack te betalen

Alibaba verkoopt 710 miljoen nieuwe aandelen in Hongkong voor 10,2 miljard dollar en investeert de volledige opbrengst in chips, AI-infrastructuur en de ontwikkeling van modellen. Wat dat betekent voor teams die op Qwen en Alibaba Cloud draaien.

AT&T verlaagt kosten van AI-taken met 56 procent via open modellen
Nieuws
4 min

21 aug 04:09

AT&T verlaagt kosten van AI-taken met 56 procent via open modellen

AT&T stuurt vragen van medewerkers via een LiteLLM-router naar open modellen en verlaagde de kosten van codeer- en andere AI-taken met tot 56 procent, bij 2 procent kwaliteitsverlies. De uitgaven aan Anthropic en OpenAI blijven bevroren.

Het gratis AI-model met een drempel is een prijskaartje dat later wordt ingevuld
Inzicht
7 min

15 aug 17:00

Het gratis AI-model met een drempel is een prijskaartje dat later wordt ingevuld

Qwen, Kimi, Llama en Gemma zetten voorwaarden op je omzet, je gebruikersaantal en je merknaam. Een gratis model met een drempel is geen open source, maar een inkoopbeslissing die je vooruitschuift naar het moment dat je niet meer weg kunt.

Qwen passeert 3 miljard downloads en verdringt Llama en Gemma
Nieuws
5 min

15 aug 12:35

Qwen passeert 3 miljard downloads en verdringt Llama en Gemma

Alibaba's open Qwen-modellen zijn in zes maanden 3 miljard keer gedownload en gaan Meta en Google voorbij. Het cijfer komt van Alibaba zelf, terwijl Hugging Face op de eigen Hub ruim 2 miljard telt.

Witte Huis breidt AI-raamwerk uit naar open modellen
Nieuws
4 min

13 aug 02:24

Witte Huis breidt AI-raamwerk uit naar open modellen

Open AI-modellen komen in de komende maanden onder het Amerikaanse toetsingsraamwerk zodra ze het niveau van GPT-5.6 halen, meldt WIRED. Tien dagen geleden bleven ze er nog uitdrukkelijk buiten.