Kolibri, Aleph Alpha’s Duits-Engelse AI-model, verscheen op 3 oktober met downloadbare gewichten onder Apache 2.0, zodat organisaties het lokaal kunnen draaien, meldt het bedrijf.
Voor Nederlandse organisaties met vertrouwelijke dossiers maakt dit een eigen AI-omgeving mogelijk, zonder documenten naar een externe modeldienst te sturen. De modelkaart beperkt Apache 2.0 tot gewichten en configuratie, vermeldt circa 78 GB geheugen voor de FP8-gewichten en noemt Duits en Engels als talen.
Apache 2.0 geldt niet voor het hele model
Kolibri is een open-weightsmodel, geen volledig open-sourcepakket. Apache 2.0 geldt alleen voor de gepubliceerde gewichten en configuratiebestanden. De licentie strekt zich niet uit tot onderliggende code, modelarchitectuur, parameterinstellingen of trainingsmethoden. Het model telt 78,1 miljard parameters; per token zijn er 3,46 miljard actief.
Die beperkte rekenlast per token verlaagt de geheugendrempel niet: de volledige gewichten moeten tegelijk beschikbaar zijn. Als minimale opstelling noemt Aleph Alpha twee A100-kaarten van 80 GB of twee H100 SXM5-kaarten; één H200, B200 of B300 volstaat ook. Voor serveren met vLLM is een aparte inferentieplug-in met een eigen Apache 2.0-licentie nodig. Een organisatie die geen geschikte GPU’s bezit, kan capaciteit huren, maar houdt dan nog steeds het beheer van de modelomgeving.
Kolibri kan een context tot 1.048.576 tokens verwerken. Aleph Alpha adviseert maximaal 262.144 tokens voor efficiënte bediening en complexe taken. De miljoenstokenlengte is dus een maximum, geen belofte dat ieder verzoek op die schaal snel of goedkoop draait.
Taal en hardware bepalen de inzet
De documentatie noemt alleen Duits en Engels als ondersteunde talen. Nederlands staat niet in die lijst, dus de kwaliteit voor Nederlandstalige bedrijfsdocumenten is niet door de leverancier gespecificeerd. Dat maakt een lokale verwerking van vertrouwelijke gegevens mogelijk, maar zegt nog niet of het model past bij Nederlandstalige werkstromen.
De zelfhostdrempel ligt hoger dan bij Alibaba’s Qwen3.8-27B, waarvan een 4-bitvariant van 16,8 GB op een videokaart met 24 GB past. De quantisaties verschillen, dus dit is geen prestatievergelijking. Het laat wel zien dat Kolibri meer geheugen en zwaardere accelerators vraagt.
Aleph Alpha zegt dat Kolibri in Duitsland is ontwikkeld en op infrastructuur in Duitsland en Finland is getraind, onder Duits en Europees recht. De downloadbare gewichten geven een Nederlandse organisatie daarna zelf de keuze waar inferentie en vertrouwelijke documenten samenkomen. De praktische ruimte hangt af van geschikte GPU-capaciteit, taalfit en de afgebakende rechten op de modelgewichten.
Veelgestelde vragen
AI in eigen beheer
Ik denk met je mee over wat je zelf wilt hosten, ontwerp de oplossing en bouw die end-to-end, van datakoppeling tot automatisering. Waar dat kan, houd ik software en data in je eigen omgeving.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
