Bonsai 2 27B brengt 27B-klasse redeneercapaciteit lokaal naar pc’s en Apple-apparaten, meldt PrismML, met een modelbestand van 5,9 GB en 98,2 procent van de score van Qwen3.8 27B.
Voor een Nederlands team dat vertrouwelijke documenten, lage vertraging of offline werking nodig heeft, verandert daarmee de inzet. AI hoeft niet voor elke vraag naar een cloudmodel. De kosten verschuiven wel naar eigen hardware, stroom, beheer en een runtime die het model kan draaien.
Wat er nu nieuw is
De release bouwt voort op Bonsai 27B, het redeneermodel dat PrismML tot minder dan 4 GB op een iPhone terugbracht. Bonsai 2 gebruikt Qwen3.8 27B als basis en richt zich volgens PrismML op sterker redeneren, programmeren, beeldbegrip en agentisch gereedschapsgebruik.
De eerste Bonsai 27B behield volgens TechCrunch ongeveer 95 procent van de oorspronkelijke benchmarkscore. De nieuwe versie komt volgens PrismML uit op 98,2 procent van de aggregate score van het volledige model. De gewichten zijn sinds 17 september gratis beschikbaar onder de Apache 2.0-licentie.
De cijfers hebben een grens
PrismML meldt een score van 83,9 tegenover 85,4 voor de volledige versie, gemeten over een suite van twintig benchmarks. Dat is een gemiddelde. Het betekent niet dat elke taak vrijwel hetzelfde uitpakt.
Op de officiële modelkaart blijven wiskunde en code dicht bij de basisversie, terwijl het verschil bij beeldbegrip groter is: 66,19 tegenover 71,36. Voor agentisch gereedschapsgebruik staat Bonsai 2 op 74,92 tegenover 76,74. Een team dat vooral tekst, code of rekenwerk lokaal wil verwerken, kijkt dus naar een ander profiel dan een team dat veel afbeeldingen analyseert.
5,9 GB is niet de hele installatie
De lage omvang komt door ternary gewichten met de waarden min één, nul en plus één, aangevuld met schaalfactoren in FP16. PrismML vergelijkt het model met een versie van ongeveer 54 GB in volledige precisie, een geheugenbesparing van meer dan negen keer.
De modelkaart maakt de hardwarekeuze concreter. De compacte PTQ1_0-verpakking is 5,95 GB; de PQ2_0-verpakking is 7,21 GB. Daar komen werkgeheugen, context en bij beeldinvoer een aparte visioncomponent bij. De 5,9 GB is dus de modelgrootte, niet de totale geheugenbehoefte van een draaiende toepassing.
Bonsai 2 werkt op NVIDIA-GPU’s via CUDA en op Apple-hardware via MLX, met eigen lage-bit-kernels. De standaardversie van llama.cpp kan deze gewichten niet laden. Voor een productieomgeving hoort de keuze voor de juiste runtime daarom bij de implementatie, net als testen op de hardware die een team werkelijk gebruikt.
De cloud krijgt een tweede inzetplek
Lokale inferentie kan prompts en documenten op het eigen apparaat houden. Dat verkort de dataroute en maakt werken zonder netwerk mogelijk, maar privacy ontstaat niet vanzelf: logging, opslag, toegangsrechten en koppelingen moeten nog steeds goed worden ingericht.
Voor Nederlandse ondernemers verandert vooral de rekensom. Een lokale toepassing betaalt niet per aanvraag aan een model-API, maar vraagt wel om geschikte apparaten, updates, toezicht en technische kennis. Een hybride opzet ligt daardoor voor de hand: lokale verwerking waar gegevens of vertraging zwaar wegen, cloudcapaciteit waar schaal of een andere modelsterkte belangrijker is.
De inzet gaat daardoor verder dan een lokaal chatvenster. PrismML noemt een contextvenster van 262.000 tokens en tekst- en beeldinvoer. Dat maakt lange documenten, screenshots en interne werkstromen denkbaar zonder de brondata eerst naar een externe API te sturen. Het blijft een technische mogelijkheid, geen kant-en-klare bedrijfsapplicatie: documentrechten, logging, evaluaties en een gebruikersinterface moeten nog worden ontworpen en onderhouden.
Bonsai 2 maakt van lokale AI geen gratis vervanging voor de cloud. Het maakt de plaats waar een model draait wel tot een echte ontwerpkeuze. Voor organisaties verschuift de vraag daardoor van alleen het slimste model naar de combinatie van taak, hardware, gegevens en beheer.
Veelgestelde vragen
Lokale AI werkbaar maken
Ik denk mee over de juiste modelkeuze en ontwerp de hele route van gegevens en hardware tot een werkende toepassing. Ik bouw en automatiseer end-to-end, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
