Laptop met broncode op het scherm op een bureau
Nieuws22 september · 03:114 min leestijd

Xiaomi maakt MiMo-V2.6 Pro en Flash open source

Xiaomi maakt MiMo-V2.6 Pro en Flash open source met MIT-gelicentieerde modelkaarten, lokale inzet via vLLM en SGLang en een contextvenster van 1 miljoen tokens. Voor ontwikkelteams verschuift de keuze naar kwaliteit, prijs, hardware en beheer.

MiMo-V2.6 Pro en Flash komen als open modellen beschikbaar, meldt Xiaomi op 22 september, met gewichten en technische rapporten voor softwareontwikkeling, computer use en multimodale taken.

Voor een Nederlandse ontwikkelorganisatie verschuift daarmee de keuze van alleen een API afnemen naar een vergelijking tussen gehost gebruik en eigen infrastructuur. Beide checkpoints staan op Hugging Face met een MIT-licentie en krijgen instructies voor lokaal draaien via vLLM, SGLang en Docker.

Twee checkpoints, twee rekensommen

MiMo-V2.6-Pro is het vlaggenschip: een sparse MoE-model met 1,02 biljoen parameters, waarvan er 42 miljard per stap actief zijn. MiMo-V2.6-Flash telt 309 miljard parameters, met 15 miljard actieve parameters. Beide modelkaarten noemen een contextvenster van 1 miljoen tokens en ondersteuning voor tekst, beeld, video en audio. De Pro-modelkaart vermeldt de MIT-licentie en lokale inzet met vLLM en SGLang; de Flash-kaart beschrijft dezelfde route voor het lichtere checkpoint.

De door Xiaomi gepubliceerde evaluaties zetten Pro op 71,9 en Flash op 67,9 op DeepSWE v1.1, een test voor software-engineering. Op MiMo Visual Coding rapporteert Xiaomi 72,3 voor Pro en 71,5 voor Flash. Dat zijn modelkaartscores van de maker, geen onafhankelijke productiviteitstest. Voor een ontwikkelteam geven ze wel een eerste scheiding tussen een model voor zwaardere taken en een model voor hogere frequentie.

Open source is niet automatisch lokaal goedkoop

De checkpoints zijn groot genoeg om de infrastructuurkeuze mee te laten wegen. De officiële inzetvoorbeelden adviseren voor Pro tensor parallel 8 en voor Flash tensor parallel 4. Self-hosting betekent hier dus niet dat een team het model zonder meer op een gewone server draait. Het betekent dat gewichten, data en aanroepen binnen een eigen omgeving kunnen blijven, als de organisatie ook de GPU-capaciteit en het beheer kan dragen.

Wie eerst gehost wil testen, krijgt een andere rekensom. De actuele prijsinformatie noemt voor niet-gecachete invoer 0,14 dollar per miljoen tokens voor Flash en 0,435 dollar voor Pro. Uitvoer kost respectievelijk 0,28 en 0,87 dollar per miljoen tokens, volgens de release-informatie over de MiMo-V2.6-prijzen.

Officiële prijskaart van Xiaomi MiMo-V2.6 per miljoen tokens, bron: Xiaomi MiMo
Officiële prijskaart van Xiaomi MiMo-V2.6 per miljoen tokens, bron: Xiaomi MiMo

De keuze zit in de hele stack

Xiaomi publiceert naast de gewichten ook een technisch rapport, meer dan 7.000 reinforcement-learning-omgevingen, een end-to-end trainingsraamwerk en lichte, samenstelbare hulpmiddelen voor agenten. Dat maakt de release interessanter voor teams die niet alleen een model willen aanroepen, maar ook hun evaluaties en werkwijze zelf willen aanpassen.

De licentieclaim blijft wel precies afgebakend. De modelkaarten voor Pro-RL en Flash-RL vermelden MIT voor de checkpoints. De runtime, GPU-software en afzonderlijke trainingsonderdelen hebben hun eigen voorwaarden en moeten apart worden gecontroleerd.

De release verschuift modelkeuze daardoor van een vergelijking van API-antwoorden naar een beslissing over kwaliteit, tokenprijs, hardware, licenties en beheer. Een open checkpoint maakt de modelkeuze draagbaarder, maar pas de combinatie van licentie, serving-stack en GPU-budget maakt die keuze bruikbaar in productie.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Van modelkeuze naar systeem

Ik denk mee over de juiste modelkeuze, ontwerp de architectuur en bouw de koppelingen en automatisering die je nodig hebt. Van eerste proef tot live systeem, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

DeepSeek brengt V4.1-Flash uit voor multimodale agents en code
Nieuws
4 min

10 sep 12:14

DeepSeek brengt V4.1-Flash uit voor multimodale agents en code

DeepSeek brengt V4.1-Flash uit met native beeldinvoer, 1 miljoen tokens context en een tijdgebonden API-prijs. De modelkaart toont hogere scores op agentbenchmarks, terwijl caching en Nederlandse piekuren de werkelijke kosten bepalen.

Shanghai AI Lab publiceert open gewichten van Atria Dawn
Nieuws
4 min

15 sep 16:35

Shanghai AI Lab publiceert open gewichten van Atria Dawn

Shanghai AI Lab publiceert Atria Dawn Preview, een open-weight onderzoeksagent op een MoE-basis van 744 miljard parameters. De MIT-licentie opent self-hosting, maar 1,51 TB aan gewichten maakt infrastructuur onderdeel van de modelkeuze.

IFM geeft zes AI-modellen vrij met trainingscode en pre-trainingsdata
Nieuws
5 min

3 sep 18:36

IFM geeft zes AI-modellen vrij met trainingscode en pre-trainingsdata

Het Abu Dhabi-instituut IFM geeft zes AI-modellen van 0,9 tot 375 miljard parameters vrij met trainingscode en pre-trainingscorpus. Op de modelkaarten wijkt de licentie op een punt af van het persbericht.

DeepSeek zet gewichten van visiemodel V4-Flash-Vision-Exp online
Nieuws
4 min

1 sep 06:20

DeepSeek zet gewichten van visiemodel V4-Flash-Vision-Exp online

DeepSeek zette de gewichten van visiemodel V4-Flash-Vision-Exp onder de MIT-licentie op Hugging Face. Zelf hosten mag nu zonder regiobeperking, maar de repository weegt 167,8 gigabyte en is nagemeten op vier B200-kaarten.

Kimi K3 draait op 20.000 gehuurde Nvidia-chips van Alibaba
Nieuws
4 min

31 jul 16:38

Kimi K3 draait op 20.000 gehuurde Nvidia-chips van Alibaba

Moonshot draait Kimi K3 op ongeveer 20.000 Nvidia-chips die het huurt via Alibaba, meldt Bloomberg. De rekenkracht achter het goedkope open model is geleend, bij een partij die tegelijk aandeelhouder en concurrent is.

Aikido brengt Altar uit voor lokale cybersecurity
Nieuws
4 min

21 sep 18:41

Aikido brengt Altar uit voor lokale cybersecurity

Aikido brengt Altar uit, een open-weight cybersecuritymodel dat lokaal kan draaien zonder broncode naar een externe AI-dienst te sturen. Het model is gebaseerd op GLM-5.3, gebruikt 328 GB opslag en draait volgens de modelkaart op vier H200’s met vLLM.