Netwerkkabels verbinden een datacenterschakelaar.
Nieuws3 oktober · 18:452 min leestijd

Aleph Alpha publiceert Kolibri met downloadbare gewichten

Kolibri biedt een Europese route naar zelfhosting, maar vraagt 78 GB geheugen en minimaal twee A100-kaarten van 80 GB. De modelkaart noemt alleen Duits en Engels; Apache 2.0 dekt alleen gewichten en configuratie.

Kolibri, Aleph Alpha’s Duits-Engelse AI-model, verscheen op 3 oktober met downloadbare gewichten onder Apache 2.0, zodat organisaties het lokaal kunnen draaien, meldt het bedrijf.

Voor Nederlandse organisaties met vertrouwelijke dossiers maakt dit een eigen AI-omgeving mogelijk, zonder documenten naar een externe modeldienst te sturen. De modelkaart beperkt Apache 2.0 tot gewichten en configuratie, vermeldt circa 78 GB geheugen voor de FP8-gewichten en noemt Duits en Engels als talen.

Apache 2.0 geldt niet voor het hele model

Kolibri is een open-weightsmodel, geen volledig open-sourcepakket. Apache 2.0 geldt alleen voor de gepubliceerde gewichten en configuratiebestanden. De licentie strekt zich niet uit tot onderliggende code, modelarchitectuur, parameterinstellingen of trainingsmethoden. Het model telt 78,1 miljard parameters; per token zijn er 3,46 miljard actief.

Die beperkte rekenlast per token verlaagt de geheugendrempel niet: de volledige gewichten moeten tegelijk beschikbaar zijn. Als minimale opstelling noemt Aleph Alpha twee A100-kaarten van 80 GB of twee H100 SXM5-kaarten; één H200, B200 of B300 volstaat ook. Voor serveren met vLLM is een aparte inferentieplug-in met een eigen Apache 2.0-licentie nodig. Een organisatie die geen geschikte GPU’s bezit, kan capaciteit huren, maar houdt dan nog steeds het beheer van de modelomgeving.

Kolibri kan een context tot 1.048.576 tokens verwerken. Aleph Alpha adviseert maximaal 262.144 tokens voor efficiënte bediening en complexe taken. De miljoenstokenlengte is dus een maximum, geen belofte dat ieder verzoek op die schaal snel of goedkoop draait.

Taal en hardware bepalen de inzet

De documentatie noemt alleen Duits en Engels als ondersteunde talen. Nederlands staat niet in die lijst, dus de kwaliteit voor Nederlandstalige bedrijfsdocumenten is niet door de leverancier gespecificeerd. Dat maakt een lokale verwerking van vertrouwelijke gegevens mogelijk, maar zegt nog niet of het model past bij Nederlandstalige werkstromen.

De zelfhostdrempel ligt hoger dan bij Alibaba’s Qwen3.8-27B, waarvan een 4-bitvariant van 16,8 GB op een videokaart met 24 GB past. De quantisaties verschillen, dus dit is geen prestatievergelijking. Het laat wel zien dat Kolibri meer geheugen en zwaardere accelerators vraagt.

Aleph Alpha zegt dat Kolibri in Duitsland is ontwikkeld en op infrastructuur in Duitsland en Finland is getraind, onder Duits en Europees recht. De downloadbare gewichten geven een Nederlandse organisatie daarna zelf de keuze waar inferentie en vertrouwelijke documenten samenkomen. De praktische ruimte hangt af van geschikte GPU-capaciteit, taalfit en de afgebakende rechten op de modelgewichten.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

AI in eigen beheer

Ik denk met je mee over wat je zelf wilt hosten, ontwerp de oplossing en bouw die end-to-end, van datakoppeling tot automatisering. Waar dat kan, houd ik software en data in je eigen omgeving.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

Alibaba publiceert Qwen3.8-27B onder Apache 2.0, zonder omzetdrempel
Nieuws
5 min

14 aug 20:11

Alibaba publiceert Qwen3.8-27B onder Apache 2.0, zonder omzetdrempel

Alibaba zet de gewichten van Qwen3.8-27B onder Apache 2.0 op Hugging Face. Het formaat dat op één videokaart past valt daarmee buiten de licentie met de omzetdrempel van 50 miljoen dollar die het vlaggenschip wel draagt.

Welke privacy-veilige AI-chatbot voor je MKB: Proton Lumo, Mistral Le Chat of zelf hosten
Gids
Uitgebreide gids11 min

8 jul 09:00

Welke privacy-veilige AI-chatbot voor je MKB: Proton Lumo, Mistral Le Chat of zelf hosten

Geen bedrijfsdata bij Amerikaanse AI, maar welke Europese of self-hosted route past bij jou? Een koperskeuzegids die Proton Lumo, Mistral Le Chat en zelf hosten afweegt op prijs, EU-databodem en beheerslast.

Nvidia versnelt Chinese open modellen en noemt een verbod erop een omzetrisico
Nieuws
4 min

28 aug 06:23

Nvidia versnelt Chinese open modellen en noemt een verbod erop een omzetrisico

Nvidia versnelt Qwen3.8-27B op zijn eigen RTX-kaarten en noemt in het kwartaalrapport van 26 augustus een verbod op DeepSeek, Qwen of Kimi een risico voor zijn resultaten. Die risicoparagraaf staat er al sinds februari.

Modular geeft Mojo volledig vrij onder Apache 2.0, MAX houdt eigen licentie
Nieuws
4 min

19 aug 04:26

Modular geeft Mojo volledig vrij onder Apache 2.0, MAX houdt eigen licentie

Modular geeft de programmeertaal Mojo volledig vrij onder Apache 2.0, compiler en tooling erbij. Het MAX-platform waarop je modellen serveert houdt een eigen licentie, met merkplicht voor wie inferentie als dienst verkoopt.

Qwen3.8-27B evenaart GPT-5.6 Luna in onafhankelijke meting
Nieuws
5 min

18 aug 06:23

Qwen3.8-27B evenaart GPT-5.6 Luna in onafhankelijke meting

Benchmarkbureau Artificial Analysis geeft Qwen3.8-27B een 52, gelijk aan GPT-5.6 Luna. Het model past in 17 GB op een enkele videokaart, maar verbruikt 160 miljoen tokens waar de mediaan op 43 miljoen ligt.

Het gratis AI-model met een drempel is een prijskaartje dat later wordt ingevuld
Inzicht
7 min

15 aug 17:00

Het gratis AI-model met een drempel is een prijskaartje dat later wordt ingevuld

Qwen, Kimi, Llama en Gemma zetten voorwaarden op je omzet, je gebruikersaantal en je merknaam. Een gratis model met een drempel is geen open source, maar een inkoopbeslissing die je vooruitschuift naar het moment dat je niet meer weg kunt.