Een computerscherm met code.
Nieuws8 oktober · 20:295 min leestijd

JetBrains brengt Mellum2.1 uit voor codeeragenten

JetBrains brengt Mellum2.1 uit als open model voor codeeragenten. Het kan lokaal draaien, maar de benchmarks zijn zelfgerapporteerd en verschillen per taak; een aparte JetBrains-repo biedt inmiddels ook GGUF-bestanden.

Mellum2.1 kan codebases verkennen, bestanden aanpassen en eigen wijzigingen controleren, meldt JetBrains bij de release op 8 oktober van zijn open model met 12 miljard parameters en 2,5 miljard actieve parameters.

Code en modelinvoer kunnen op eigen infrastructuur blijven wanneer een Nederlands softwareteam het model zelf draait. Apache 2.0 staat gebruik, aanpassing en commercieel gebruik toe binnen de licentievoorwaarden, maar rekenkracht, updates en de toegangsrechten van de codeeragent blijven bij de organisatie. De 2,5 miljard actieve parameters beschrijven hoeveel er per token wordt gebruikt; het totale model telt 12 miljard parameters.

Van codeaanvulling naar repo-taak

Mellum2 verscheen in juni al als open 12B-MoE-model met 2,5 miljard actieve parameters. JetBrains zegt dat de eerste versie nog niet goed genoeg in repositories kon werken. Mellum2.1 laat de architectuur staan en verschuift het werk naar post-training.

Reinforcement learning ging van een korte eindfase naar een hoofdonderdeel van de training. JetBrains liet het model gedurende de zomer miljoenen sandboxruns uitvoeren in duizenden omgevingen. Het oefende met wiskunde, programmeerwedstrijden, wetenschap, gereedschapsgebruik en software-engineering. In echte repositories kreeg het een shell en bestandsbewerking; geslaagde tests leverden een beloning op.

JetBrains filterde ook open trainingsdata op kapotte tests, niet te controleren antwoorden en opdrachten die te makkelijk of onmogelijk waren. De bekendgemaakte aantallen beschrijven de trainingsomgeving, niet hoe goed het model met een onbekende Nederlandse codebase of de afspraken van een team werkt.

De score verschilt per codeertaak

JetBrains vergelijkt Mellum2.1 met Mellum2, Qwen3.5-9B en Gemma 4 E4B. De scorekaart vermeldt dat alle waarden percentages zijn en JetBrains ze met dezelfde pipeline in de denkstand heeft gemeten. Op SWE-bench Verified haalt Mellum2.1 47 procent, tegenover 2 procent voor Mellum2; Qwen3.5-9B haalt 50 procent. Mellum2.1 staat op LiveCodeBench v6 hoger dan Qwen, 82 tegenover 75,4 procent. Op Terminal-Bench 2.1 en AIME 2025/2026 staat Qwen voor, met respectievelijk 21,7 tegenover 17,4 procent en 86,7 tegenover 83,3 procent.

Benchmarkgrafiek van JetBrains met Mellum2.1, Mellum2, Qwen3.5-9B en Gemma 4 E4B op zes tests. Bron: JetBrains via Hugging Face
Benchmarkgrafiek van JetBrains met Mellum2.1, Mellum2, Qwen3.5-9B en Gemma 4 E4B op zes tests. Bron: JetBrains via Hugging Face

De agenttests gebruiken dezelfde open Pi v0.73.1-agentomgeving met shell- en bestandsgereedschap, een context van 114.000 tokens en maximaal 16.000 tokens per beurt. MarkTechPost neemt de scores over als JetBrains-metingen en noemt ze zelfgerapporteerd; het artikel is geen onafhankelijke herhaling.

JetBrains meldt op één H200 bijna twee keer zoveel outputtokens als Qwen3.5-9B onder zware belasting. Voor één aanvraag noemt het bedrijf 1,6 keer meer snelheid met multi-token prediction. De hoofdmodelkaart zegt dat de MTP-kop voor speculative decoding in vLLM nog volgt, waardoor die snelheidsclaim niet volledig na te bouwen is met de beschreven bestanden.

De aparte GGUF-repo is al live

De modelkaart geeft instructies om Mellum2.1 lokaal via Transformers, vLLM of SGLang te draaien en vermeldt een contextvenster tot 131.072 tokens. Daar staat ook dat GGUF-versies voor llama.cpp, Ollama en LM Studio nog komen. Een aparte, door JetBrains beheerde GGUF-repo biedt inmiddels vijf bestanden en opdrachten voor llama.cpp en Ollama. De hoofdkaart loopt daarmee achter op die aparte repository.

De repo biedt BF16 van 24,3 GB, Q8_0 van 12,9 GB, Q6_K van 10,9 GB, Q4_K_M van 8,1 GB en MXFP4_MOE van 7 GB. JetBrains beveelt Q4_K_M aan. Die variant heeft volgens de repo een top-tokenovereenkomst van 88 procent met BF16. Die waarde beschrijft overeenkomst tussen voorspelde tokens op Wikitext-2 bij context 512; de meting test geen programmeertaken. Het model heeft 12 miljard parameters in totaal, ook al worden er 2,5 miljard per token gebruikt. Het BF16-bestand en de extra ruimte voor runtime en context blijven dus van belang bij de hardwarekeuze.

De modelkaart vermeldt Apache 2.0. Die staat gebruik, wijziging en distributie toe onder voorwaarden zoals het meeleveren van de licentie en relevante vermeldingen. OpenBMB's Apache-model met 2,52 miljard parameters bracht modelaanroepen en beheer naar eigen hardware. Bij Mellum2.1 komt daar de toegang tot broncode bij: lokaal draaien bepaalt waar het model rekent, maar niet vanzelf welke bestanden of commando's de agent mag gebruiken.

De eigen repository blijft de meetlat

De scores laten zien dat Mellum2.1 op een reeks codetests stijgt, terwijl Qwen op andere codeer- en redeneertaken hoger uitkomt. De modelkaart noemt geen onafhankelijke test op een echte teamcodebase, kosten per opgeloste taak of prestaties op gangbare Nederlandse hardware. Ook de bijna tweevoudige doorvoer is gemeten op één H200.

Daarom zegt een benchmark op je eigen taak meer dan een leaderboardscore uit een andere opdracht. Apache 2.0, een lokale vLLM-route en de inmiddels downloadbare GGUF-bestanden maken experimenteren met codeeragenten bereikbaar. Mellum2.1 legt de nadruk op werk in repositories, waar modelkeuze, hardware, broncoderechten en agentbevoegdheden samen de uitkomst bepalen. JetBrains publiceert de gewichten en benchmarkresultaten; het team dat ze inzet, bepaalt wat de agent kan lezen, wijzigen en uitvoeren.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Van model naar eigen proces

Ik denk mee over het proces, ontwerp de oplossing en realiseer de hele keten rond een agent, van eerste idee tot automatisering. Waar dat kan, laat ik de verwerking op je eigen infrastructuur draaien.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

Het gratis AI-model met een drempel is een prijskaartje dat later wordt ingevuld
Inzicht
7 min

15 aug 17:00

Het gratis AI-model met een drempel is een prijskaartje dat later wordt ingevuld

Qwen, Kimi, Llama en Gemma zetten voorwaarden op je omzet, je gebruikersaantal en je merknaam. Een gratis model met een drempel is geen open source, maar een inkoopbeslissing die je vooruitschuift naar het moment dat je niet meer weg kunt.

Qwen passeert 3 miljard downloads en verdringt Llama en Gemma
Nieuws
5 min

15 aug 12:35

Qwen passeert 3 miljard downloads en verdringt Llama en Gemma

Alibaba's open Qwen-modellen zijn in zes maanden 3 miljard keer gedownload en gaan Meta en Google voorbij. Het cijfer komt van Alibaba zelf, terwijl Hugging Face op de eigen Hub ruim 2 miljard telt.

OpenBMB brengt MiniCPM5-2B uit voor lokale AI
Nieuws
4 min

8 sep 13:01

OpenBMB brengt MiniCPM5-2B uit voor lokale AI

OpenBMB brengt MiniCPM5-2B uit: een Apache-2.0-model met 2,52 miljard parameters, vrijgegeven trainingsdatasets en varianten voor lokale inzet. De praktische keuze draait om hardware, privacy en het beheer dat uit de cloud terugkomt.

Alibaba zet Qwen3.8-Flash-Next open en rekent 0,16 dollar per miljoen tokens
Nieuws
5 min

27 aug 02:22

Alibaba zet Qwen3.8-Flash-Next open en rekent 0,16 dollar per miljoen tokens

Alibaba zet de gewichten van Qwen3.8-Flash-Next open. Het model activeert 6 van 176 miljard parameters per token, kost gehost 0,16 dollar per miljoen invoertokens en komt met een strakkere licentie dan het vlaggenschip.

Qwen3.8-27B evenaart GPT-5.6 Luna in onafhankelijke meting
Nieuws
5 min

18 aug 06:23

Qwen3.8-27B evenaart GPT-5.6 Luna in onafhankelijke meting

Benchmarkbureau Artificial Analysis geeft Qwen3.8-27B een 52, gelijk aan GPT-5.6 Luna. Het model past in 17 GB op een enkele videokaart, maar verbruikt 160 miljoen tokens waar de mediaan op 43 miljoen ligt.

Alibaba publiceert Qwen3.8-27B onder Apache 2.0, zonder omzetdrempel
Nieuws
5 min

14 aug 20:11

Alibaba publiceert Qwen3.8-27B onder Apache 2.0, zonder omzetdrempel

Alibaba zet de gewichten van Qwen3.8-27B onder Apache 2.0 op Hugging Face. Het formaat dat op één videokaart past valt daarmee buiten de licentie met de omzetdrempel van 50 miljoen dollar die het vlaggenschip wel draagt.