MiMo-V2.6 Pro en Flash komen als open modellen beschikbaar, meldt Xiaomi op 22 september, met gewichten en technische rapporten voor softwareontwikkeling, computer use en multimodale taken.
Voor een Nederlandse ontwikkelorganisatie verschuift daarmee de keuze van alleen een API afnemen naar een vergelijking tussen gehost gebruik en eigen infrastructuur. Beide checkpoints staan op Hugging Face met een MIT-licentie en krijgen instructies voor lokaal draaien via vLLM, SGLang en Docker.
Twee checkpoints, twee rekensommen
MiMo-V2.6-Pro is het vlaggenschip: een sparse MoE-model met 1,02 biljoen parameters, waarvan er 42 miljard per stap actief zijn. MiMo-V2.6-Flash telt 309 miljard parameters, met 15 miljard actieve parameters. Beide modelkaarten noemen een contextvenster van 1 miljoen tokens en ondersteuning voor tekst, beeld, video en audio. De Pro-modelkaart vermeldt de MIT-licentie en lokale inzet met vLLM en SGLang; de Flash-kaart beschrijft dezelfde route voor het lichtere checkpoint.
De door Xiaomi gepubliceerde evaluaties zetten Pro op 71,9 en Flash op 67,9 op DeepSWE v1.1, een test voor software-engineering. Op MiMo Visual Coding rapporteert Xiaomi 72,3 voor Pro en 71,5 voor Flash. Dat zijn modelkaartscores van de maker, geen onafhankelijke productiviteitstest. Voor een ontwikkelteam geven ze wel een eerste scheiding tussen een model voor zwaardere taken en een model voor hogere frequentie.
Open source is niet automatisch lokaal goedkoop
De checkpoints zijn groot genoeg om de infrastructuurkeuze mee te laten wegen. De officiële inzetvoorbeelden adviseren voor Pro tensor parallel 8 en voor Flash tensor parallel 4. Self-hosting betekent hier dus niet dat een team het model zonder meer op een gewone server draait. Het betekent dat gewichten, data en aanroepen binnen een eigen omgeving kunnen blijven, als de organisatie ook de GPU-capaciteit en het beheer kan dragen.
Wie eerst gehost wil testen, krijgt een andere rekensom. De actuele prijsinformatie noemt voor niet-gecachete invoer 0,14 dollar per miljoen tokens voor Flash en 0,435 dollar voor Pro. Uitvoer kost respectievelijk 0,28 en 0,87 dollar per miljoen tokens, volgens de release-informatie over de MiMo-V2.6-prijzen.

De keuze zit in de hele stack
Xiaomi publiceert naast de gewichten ook een technisch rapport, meer dan 7.000 reinforcement-learning-omgevingen, een end-to-end trainingsraamwerk en lichte, samenstelbare hulpmiddelen voor agenten. Dat maakt de release interessanter voor teams die niet alleen een model willen aanroepen, maar ook hun evaluaties en werkwijze zelf willen aanpassen.
De licentieclaim blijft wel precies afgebakend. De modelkaarten voor Pro-RL en Flash-RL vermelden MIT voor de checkpoints. De runtime, GPU-software en afzonderlijke trainingsonderdelen hebben hun eigen voorwaarden en moeten apart worden gecontroleerd.
De release verschuift modelkeuze daardoor van een vergelijking van API-antwoorden naar een beslissing over kwaliteit, tokenprijs, hardware, licenties en beheer. Een open checkpoint maakt de modelkeuze draagbaarder, maar pas de combinatie van licentie, serving-stack en GPU-budget maakt die keuze bruikbaar in productie.
Veelgestelde vragen
Van modelkeuze naar systeem
Ik denk mee over de juiste modelkeuze, ontwerp de architectuur en bouw de koppelingen en automatisering die je nodig hebt. Van eerste proef tot live systeem, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
