Een hand houdt een smartphone vast tegen een donkere achtergrond.
Nieuws15 juli · 20:224 min leestijd

PrismML propt een 27B-redeneermodel in 4 GB op je iPhone

Een spin-off van Caltech comprimeert een volwaardig redeneermodel van 27 miljard parameters tot minder dan 4 gigabyte, klein genoeg voor een iPhone zonder cloud. Lokale AI zonder tokenrekening komt zo binnen bereik van elk bedrijf.

PrismML, een spin-off van Caltech, heeft een open redeneermodel van 27 miljard parameters teruggebracht van 54 naar minder dan 4 gigabyte, klein genoeg om zonder cloud op een iPhone te draaien. Het model, Bonsai 27B, kwam op 14 juli 2026 uit en houdt naar eigen zeggen 90 tot 95 procent van de oorspronkelijke prestaties over.

Voor een Nederlands bedrijf verschuift dat de rekensom onder AI. Een volwaardig redeneermodel dat lokaal op een telefoon of laptop draait, stuurt geen enkele prompt naar een externe API: je data blijft op het apparaat, er is geen tokenrekening, en het werkt ook zonder internet. Tot nu toe betekende AI op je eigen hardware kiezen voor een klein, beperkt model. Bonsai laat zien dat ook een groter redeneermodel binnen die grens past.

Wat PrismML precies heeft gedaan

Bonsai 27B is een gecomprimeerde versie van Alibaba's Qwen3.6-27B. In plaats van de gebruikelijke 16 bits per gewicht gebruikt PrismML een agressieve 1- tot 2-bits quantisatie, waardoor het model van ongeveer 54 gigabyte naar 5,9 gigabyte (laptopvariant) en 3,9 gigabyte (telefoonvariant) krimpt. De gewichten staan open onder een Apache 2.0-licentie, dus je mag het model zelf draaien en aanpassen.

Bestandsgrootte van het 27B-model per compressiestap, in GB (bron: The Decoder)

De prijs van die compressie valt mee. De grotere variant houdt zo'n 95 procent van de oorspronkelijke prestaties over, de kleinste variant rond de 90 procent, en op wiskunde en programmeren is het verschil vrijwel niet te merken. Waar het model wel terrein verliest, is beeldbegrip, het opvolgen van instructies en agent-achtig gereedschapsgebruik.

Op een iPhone 17 Pro Max haalt Bonsai ongeveer 11 tokens per seconde en zo'n 67.000 tokens op een volle accu, genoeg voor echt werk in plaats van een demo. Volgens PrismML draait het model op elke iPhone 15 of nieuwer.

Waarom lokale AI de rekensom verandert

Voor bedrijven die met persoonsgegevens of vertrouwelijke documenten werken, is dat lokale karakter het echte punt. Een model dat op het apparaat blijft, stuurt niets naar een server in een ander rechtsgebied, en dat scheelt zowel een cloudrekening als een privacyvraag. Liquid AI liet eerder al zien dat een taalmodel van 230 miljoen parameters op een telefoon zonder internet data kan uitlezen, maar dat model is bewust klein en beperkt in wat het kan. Het nieuwe aan Bonsai is dat het om een volwaardig redeneermodel gaat, dat meerstaps kan nadenken en gereedschap kan aansturen.

Dat maakt on-device AI voor het eerst bruikbaar voor het soort taken waar je nu nog een cloud-API voor huurt: een document samenvatten, een berekening controleren, code schrijven. Wie zulke taken lokaal draait, betaalt niet per token en houdt de gegevens binnen de eigen muren.

Apple kijkt mee

De aankondiging valt niet los te zien van Apple. PrismML-topman Babak Hassibi zei tegenover CNBC dat Apple de compressietechniek nu actief test op snelheid, energieverbruik en prestaties, al noemt hij de gesprekken pril: het "vordert netjes", maar het is een vroege fase. Apple bracht een dag voor de release, op 13 juli, de eerste publieke bèta van iOS 27 uit, gebouwd rond een vernieuwde Siri AI. Apple zelf wilde niet reageren.

De grotere beweging is dat de grens tussen cloud-AI en AI op je eigen apparaat aan het vervagen is. Waar zwaar redeneerwerk tot voor kort een datacenter vereiste, past het nu op hardware die je al in je zak hebt. Voor bedrijven die twijfelen tussen een maandelijkse API-rekening en volledige controle over hun eigen data, wordt zelf draaien een steeds serieuzer alternatief, en niet langer alleen voor de kleinste modellen.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

AI binnen je eigen muren

Wil je AI die je gegevens niet naar een cloud stuurt? Ik denk mee als ondernemer, ontwerp de aanpak en bouw self-hosted oplossingen end-to-end, van het eerste idee tot een werkend systeem dat je zelf beheert.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

Het gratis AI-model met een drempel is een prijskaartje dat later wordt ingevuld
Inzicht
7 min

15 aug 17:00

Het gratis AI-model met een drempel is een prijskaartje dat later wordt ingevuld

Qwen, Kimi, Llama en Gemma zetten voorwaarden op je omzet, je gebruikersaantal en je merknaam. Een gratis model met een drempel is geen open source, maar een inkoopbeslissing die je vooruitschuift naar het moment dat je niet meer weg kunt.

Qwen3.8-27B evenaart GPT-5.6 Luna in onafhankelijke meting
Nieuws
5 min

18 aug 06:23

Qwen3.8-27B evenaart GPT-5.6 Luna in onafhankelijke meting

Benchmarkbureau Artificial Analysis geeft Qwen3.8-27B een 52, gelijk aan GPT-5.6 Luna. Het model past in 17 GB op een enkele videokaart, maar verbruikt 160 miljoen tokens waar de mediaan op 43 miljoen ligt.

Qwen passeert 3 miljard downloads en verdringt Llama en Gemma
Nieuws
5 min

15 aug 12:35

Qwen passeert 3 miljard downloads en verdringt Llama en Gemma

Alibaba's open Qwen-modellen zijn in zes maanden 3 miljard keer gedownload en gaan Meta en Google voorbij. Het cijfer komt van Alibaba zelf, terwijl Hugging Face op de eigen Hub ruim 2 miljard telt.

Alibaba publiceert Qwen3.8-27B onder Apache 2.0, zonder omzetdrempel
Nieuws
5 min

14 aug 20:11

Alibaba publiceert Qwen3.8-27B onder Apache 2.0, zonder omzetdrempel

Alibaba zet de gewichten van Qwen3.8-27B onder Apache 2.0 op Hugging Face. Het formaat dat op één videokaart past valt daarmee buiten de licentie met de omzetdrempel van 50 miljoen dollar die het vlaggenschip wel draagt.

Alibaba publiceert Qwen3.8-licentie met drempel van 50 miljoen dollar
Nieuws
5 min

13 aug 16:16

Alibaba publiceert Qwen3.8-licentie met drempel van 50 miljoen dollar

Alibaba publiceerde de licentie bij Qwen3.8-Max. Boven 50 miljoen dollar omzet uit een model-als-dienst of AI-werkassistent is vooraf een aparte overeenkomst nodig. Intern gebruik blijft vrij, maar Apache 2.0 is het niet meer.

Meta geeft agentmodel Muse Glimmer vrij onder Apache 2.0
Nieuws
6 min

10 aug 14:09

Meta geeft agentmodel Muse Glimmer vrij onder Apache 2.0

Meta zet de gewichten van agentmodel Muse Glimmer onder Apache 2.0 op Hugging Face. Het model van 30 miljard parameters draait op één consumenten-GPU en keert de gesloten koers van juni om.