Laptop met broncode op het scherm
Nieuws18 september · 03:004 min leestijd

PrismML brengt Bonsai 2 27B naar pc en smartphone

PrismML brengt Bonsai 2 27B naar lokale pc’s en Apple-apparaten. Het model is 5,9 GB groot, behoudt volgens PrismML 98,2 procent van de benchmarkscore en draait onder Apache 2.0.

Bonsai 2 27B brengt 27B-klasse redeneercapaciteit lokaal naar pc’s en Apple-apparaten, meldt PrismML, met een modelbestand van 5,9 GB en 98,2 procent van de score van Qwen3.8 27B.

Voor een Nederlands team dat vertrouwelijke documenten, lage vertraging of offline werking nodig heeft, verandert daarmee de inzet. AI hoeft niet voor elke vraag naar een cloudmodel. De kosten verschuiven wel naar eigen hardware, stroom, beheer en een runtime die het model kan draaien.

Wat er nu nieuw is

De release bouwt voort op Bonsai 27B, het redeneermodel dat PrismML tot minder dan 4 GB op een iPhone terugbracht. Bonsai 2 gebruikt Qwen3.8 27B als basis en richt zich volgens PrismML op sterker redeneren, programmeren, beeldbegrip en agentisch gereedschapsgebruik.

De eerste Bonsai 27B behield volgens TechCrunch ongeveer 95 procent van de oorspronkelijke benchmarkscore. De nieuwe versie komt volgens PrismML uit op 98,2 procent van de aggregate score van het volledige model. De gewichten zijn sinds 17 september gratis beschikbaar onder de Apache 2.0-licentie.

De cijfers hebben een grens

PrismML meldt een score van 83,9 tegenover 85,4 voor de volledige versie, gemeten over een suite van twintig benchmarks. Dat is een gemiddelde. Het betekent niet dat elke taak vrijwel hetzelfde uitpakt.

Op de officiële modelkaart blijven wiskunde en code dicht bij de basisversie, terwijl het verschil bij beeldbegrip groter is: 66,19 tegenover 71,36. Voor agentisch gereedschapsgebruik staat Bonsai 2 op 74,92 tegenover 76,74. Een team dat vooral tekst, code of rekenwerk lokaal wil verwerken, kijkt dus naar een ander profiel dan een team dat veel afbeeldingen analyseert.

5,9 GB is niet de hele installatie

De lage omvang komt door ternary gewichten met de waarden min één, nul en plus één, aangevuld met schaalfactoren in FP16. PrismML vergelijkt het model met een versie van ongeveer 54 GB in volledige precisie, een geheugenbesparing van meer dan negen keer.

De modelkaart maakt de hardwarekeuze concreter. De compacte PTQ1_0-verpakking is 5,95 GB; de PQ2_0-verpakking is 7,21 GB. Daar komen werkgeheugen, context en bij beeldinvoer een aparte visioncomponent bij. De 5,9 GB is dus de modelgrootte, niet de totale geheugenbehoefte van een draaiende toepassing.

Bonsai 2 werkt op NVIDIA-GPU’s via CUDA en op Apple-hardware via MLX, met eigen lage-bit-kernels. De standaardversie van llama.cpp kan deze gewichten niet laden. Voor een productieomgeving hoort de keuze voor de juiste runtime daarom bij de implementatie, net als testen op de hardware die een team werkelijk gebruikt.

De cloud krijgt een tweede inzetplek

Lokale inferentie kan prompts en documenten op het eigen apparaat houden. Dat verkort de dataroute en maakt werken zonder netwerk mogelijk, maar privacy ontstaat niet vanzelf: logging, opslag, toegangsrechten en koppelingen moeten nog steeds goed worden ingericht.

Voor Nederlandse ondernemers verandert vooral de rekensom. Een lokale toepassing betaalt niet per aanvraag aan een model-API, maar vraagt wel om geschikte apparaten, updates, toezicht en technische kennis. Een hybride opzet ligt daardoor voor de hand: lokale verwerking waar gegevens of vertraging zwaar wegen, cloudcapaciteit waar schaal of een andere modelsterkte belangrijker is.

De inzet gaat daardoor verder dan een lokaal chatvenster. PrismML noemt een contextvenster van 262.000 tokens en tekst- en beeldinvoer. Dat maakt lange documenten, screenshots en interne werkstromen denkbaar zonder de brondata eerst naar een externe API te sturen. Het blijft een technische mogelijkheid, geen kant-en-klare bedrijfsapplicatie: documentrechten, logging, evaluaties en een gebruikersinterface moeten nog worden ontworpen en onderhouden.

Bonsai 2 maakt van lokale AI geen gratis vervanging voor de cloud. Het maakt de plaats waar een model draait wel tot een echte ontwerpkeuze. Voor organisaties verschuift de vraag daardoor van alleen het slimste model naar de combinatie van taak, hardware, gegevens en beheer.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Lokale AI werkbaar maken

Ik denk mee over de juiste modelkeuze en ontwerp de hele route van gegevens en hardware tot een werkende toepassing. Ik bouw en automatiseer end-to-end, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

Open-weightmodellen verkorten achterstand op Amerikaanse frontier tot 4,4 maanden
Nieuws
4 min

16 sep 14:14

Open-weightmodellen verkorten achterstand op Amerikaanse frontier tot 4,4 maanden

Mozilla meet de achterstand tussen open-weight- en gesloten AI-modellen op 4,4 maanden. De prijs-prestatieverhouding verschuift, maar hardware, hosting en professioneel kenniswerk blijven bepalend voor modelkeuze.

Shanghai AI Lab publiceert open gewichten van Atria Dawn
Nieuws
4 min

15 sep 16:35

Shanghai AI Lab publiceert open gewichten van Atria Dawn

Shanghai AI Lab publiceert Atria Dawn Preview, een open-weight onderzoeksagent op een MoE-basis van 744 miljard parameters. De MIT-licentie opent self-hosting, maar 1,51 TB aan gewichten maakt infrastructuur onderdeel van de modelkeuze.

Mila en Mozilla bouwen open-source AI-fundament
Nieuws
4 min

17 sep 23:10

Mila en Mozilla bouwen open-source AI-fundament

Mila en Mozilla starten met Canadese steun een open-source AI-laag die organisaties lokaal kunnen draaien. De inzet: open standaarden, een installeerbare referentie-implementatie en minder afhankelijkheid van gesloten AI-diensten.

Base Labs bouwt veiligheidsinfrastructuur voor open-weightmodellen
Nieuws
3 min

17 sep 20:33

Base Labs bouwt veiligheidsinfrastructuur voor open-weightmodellen

Base Labs, Hugging Face en Goodfire werken aan open veiligheidsinfrastructuur voor modeltraining en runtime-monitoring. De methoden zijn nog niet vrijgegeven, maar self-hosted modellen moeten tijdens gebruik controleerbaar blijven.

Cohere versleutelt AI-inferentie in Model Vault
Nieuws
4 min

17 sep 02:31

Cohere versleutelt AI-inferentie in Model Vault

Cohere voegt confidential computing toe aan Model Vault. Prompts en antwoorden blijven tijdens inferentie versleuteld in hardware-TEE’s, terwijl klanten de draaiende code en beveiligingspolicy vóór verzending kunnen laten attesteren.

Amerikaanse commissie stuurt wetsvoorstel voor open AI-modellen door
Nieuws
4 min

16 sep 21:02

Amerikaanse commissie stuurt wetsvoorstel voor open AI-modellen door

De Amerikaanse Energy and Commerce Committee stuurt H.R. 10152 vooruit. Het voorstel koppelt steun voor Amerikaanse open modellen aan openbare risicoanalyses van open modellen uit aangewezen landen. Dat maakt herkomst relevant in zakelijke modelinkoop.