Broncode op een computerscherm
Nieuws11 juli · 12:233 min leestijd

Onafhankelijke test zet Muse Spark 1.1 net boven GLM-5.2 op coding

De eerste onafhankelijke benchmark van Artificial Analysis zet Meta's Muse Spark 1.1 op coding net boven het open model GLM-5.2, en tegen lagere kosten per taak. Wat betekent dat voor je modelkeuze?

Muse Spark 1.1 van Meta scoort in de eerste onafhankelijke test van Artificial Analysis 71,3 op de coding-index, net boven het open model GLM-5.2 dat op 68,8 blijft, en draait tegelijk goedkoper per taak.

Toen Meta het model twee dagen eerder uitbracht, was de prijs het nieuws en ontbraken onafhankelijke cijfers nog. Die zijn er nu, en ze scherpen de rekensom aan voor een Nederlands ontwikkelteam dat een coding-agent kiest. Het gaat niet langer om Meta's eigen benchmark: een externe meetlat legt Muse Spark 1.1 naast de rest van de markt. Meta bracht Muse Spark 1.1 twee dagen eerder uit tegen een kwart van de invoerprijs van Claude Opus 4.8, maar de prestatieclaim was toen nog van de maker zelf. Nu blijkt dat het op coding nipt voor het populaire GLM-5.2 uitkomt, voor minder geld per taak.

De cijfers naast elkaar

Op de coding-index van Artificial Analysis, het gewogen gemiddelde van programmeerbenchmarks, zet de test Muse Spark 1.1 op 71,3 tegen 68,8 voor GLM-5.2. Het verschil is klein, en Muse Spark 1.1 is niet de koploper: GPT-5.6 Sol staat op 77,4 en Claude Opus 4.8 op 74,3. Op de bredere Intelligence Index, die negen tests combineert, eindigen Muse Spark 1.1 en GLM-5.2 zelfs precies gelijk op 51.

Het onderscheid zit in de kosten. Meta rekent 1,25 dollar per miljoen invoertokens en 4,25 dollar per miljoen uitvoertokens, en daarmee kost een index-taak ongeveer 0,26 dollar, tegen 0,37 dollar voor GLM-5.2. Een deel van dat voordeel komt uit zuinigheid: Muse Spark 1.1 had 94 miljoen uitvoertokens nodig om de hele index te draaien, tegen 141 miljoen voor GLM-5.2. Minder tokens voor hetzelfde werk betekent een lagere rekening bij een agent die de hele dag doordraait.

Coding-index van Artificial Analysis, geselecteerde modellen (bron: Artificial Analysis, 11 juli 2026)

Wat het verschil waard is

Een marge van tweeënhalve punt maakt van Muse Spark 1.1 geen ander gewicht dan GLM-5.2: het zijn twee modellen die op elkaars niveau presteren, met een klein prijsvoordeel voor de nieuwkomer. De echte keuze zit ergens anders. Muse Spark 1.1 is een gesloten model, voorlopig alleen in preview voor Amerikaanse ontwikkelaars en niet zelf te draaien. GLM-5.2 is open-weight: je kunt het op eigen infrastructuur zetten, al reist je broncode bij de cloud-variant naar een Chinese aanbieder.

Dat GLM-5.2 als serieuze maatstaf geldt, is geen toeval. Databricks koos het open model als standaard codeermodel voor zijn eigen ontwikkelaars nadat het Opus 4.8 evenaarde voor ongeveer een derde minder per taak, en eerder liet het model al zien dat het GPT-5.5 op coding versloeg voor een zesde van de prijs. Muse Spark 1.1 klopt nu op dezelfde deur, maar dan als gesloten API.

Waar dit heen wijst

De strijd tussen de labs verschuift zichtbaar van de ranglijst naar de kosten per token en het aantal tokens dat een model nodig heeft. Een onafhankelijke meetlat die een gesloten Amerikaans model gelijk zet aan het sterkste open Chinese model, en het op coding net erboven, maakt de modelkeuze scherper in plaats van makkelijker. Voor wie een coding-agent inzet, telt straks minder welk logo bovenaan een benchmark staat, en meer wat een taak werkelijk kost en waar je code tijdens het werk terechtkomt.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Het juiste AI-model kiezen

De keuze tussen een open en een gesloten model bepaalt je kosten, je snelheid en waar je data belandt. Ik denk met je mee, ontwerp de aanpak en bouw de agent of koppeling die eronder draait, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Moonshot lanceert Kimi K3, het grootste open AI-model ter wereld
Nieuws
4 min

18 jul 06:11

Moonshot lanceert Kimi K3, het grootste open AI-model ter wereld

Moonshot AI bracht Kimi K3 uit, met 2,8 biljoen parameters het grootste open-weight model ter wereld. De benchmarks zetten het vlak achter Claude en GPT, tegen een fractie van de prijs.

Meta lanceert betaald Muse Spark 1.1 onder de prijs van Claude Opus
Nieuws
4 min

9 jul 18:14

Meta lanceert betaald Muse Spark 1.1 onder de prijs van Claude Opus

Meta brengt met Muse Spark 1.1 zijn eerste betaalde AI-model uit, gericht op coding-agents en geprijsd op een kwart van de invoerprijs van Claude Opus 4.8. Wat verandert dat voor jouw modelkeuze?

Databricks kiest open model GLM 5.2 als standaard codeermodel na test tegen Opus
Nieuws
4

9 jul 14:36

Databricks kiest open model GLM 5.2 als standaard codeermodel na test tegen Opus

Databricks zet het open-weight model GLM 5.2 in als standaard codeermodel voor zijn ontwikkelaars. Op de eigen codebase evenaarde het Opus 4.8 voor 1,28 dollar per taak tegen 1,94 dollar.

Z.ai dicht het gat met de westerse top en haalt geld op voor AGI
Nieuws
6 min

25 jun 14:39

Z.ai dicht het gat met de westerse top en haalt geld op voor AGI

De Chinese maker van GLM-5.2 zegt het gat met de Amerikaanse frontier-modellen vrijwel te hebben gedicht en kondigt een tweede beursnotering in Shanghai aan om zijn jacht op AGI te bekostigen.

OpenAI verlaagt prijs GPT-5.6 Luna met 80 procent, Terra met 20 procent
Nieuws
4 min

30 jul 20:31

OpenAI verlaagt prijs GPT-5.6 Luna met 80 procent, Terra met 20 procent

OpenAI verlaagt de API-prijs van GPT-5.6 Luna met 80 procent en Terra met 20 procent. Daarmee wordt Terra ineens tien keer zo duur als Luna in plaats van 2,5 keer, en verschuift de rekensom voor elke agent-workflow.

Anthropic meet nul geslaagde prompt-injecties bij Opus 5 met browsertoegang
Nieuws
5 min

25 jul 14:24

Anthropic meet nul geslaagde prompt-injecties bij Opus 5 met browsertoegang

Claude Opus 5 laat in Anthropics eigen browsertest van 129 scenario's geen enkele prompt-injectie slagen met auto mode aan, en 3,7 procent zonder. Auto mode zit alleen in Anthropics eigen browserproducten.