Naive-N0.5-Flash, het 309 miljard parameters tellende model van NaiveAI, verscheen op 27 september onder MIT met open gewichten en inferentiecode voor code en AI-onderzoek, meldt het bedrijf.
Voor Nederlandse ontwikkelteams verandert de afweging tussen een gehoste model-API en zelfbeheer. De MIT-licentie staat downloaden, aanpassen en commercieel gebruik toe. De nieuwe vrijheid vraagt wel om eigen GPU-capaciteit en beheer van de modelruntime.
De gewichten vragen forse capaciteit
Naive-N0.5-Flash is een mixture-of-expertsmodel met 309 miljard parameters in totaal en 15,5 miljard actieve parameters per token. De FP8-gewichten nemen circa 315 GB in beslag en vragen extra GPU-geheugen en FP8-capabele NVIDIA-GPU's. De modelrepository toont 49 downloadbare safetensors-bestanden. De actieve parameterwaarde maakt het model dus niet licht om lokaal te draaien.

Lange context vraagt geheugen
Voor een contextvenster van 1 miljoen tokens combineert het model meestal een lokaal aandachtsvenster van 128 tokens met een sparse laag die 2.048 eerdere tokens selecteert. De volledige KV-cache, het geheugen voor eerdere tokens, blijft behouden. Grote codebases of onderzoeksdossiers passen daardoor in een langer gesprek, terwijl de geheugenvraag blijft bestaan.
NaiveAI kondigt ook API-toegang aan met tarieven van $0,10 per miljoen invoertokens, $0,40 per miljoen uitvoertokens en $0,01 per miljoen tokens die uit de cache worden gelezen. De modelrepository noemt geen startdatum voor die API.
De licentie opent het model, maar lokale inzet blijft afhankelijk van GPU-capaciteit en runtimebeheer. Nederlandse teams kunnen straks de aangekondigde API afwegen tegen het draaien en onderhouden van 315 GB aan eigen gewichten.
Veelgestelde vragen
Van model naar AI-toepassing
Ik denk mee over de modelkeuze, ontwerp de toepassing en bouw en automatiseer het hele traject tot livegang. Waar het past, draait die oplossing in jouw eigen omgeving.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

