Bureau met financiële grafieken op papier, een rekenmachine, een notitieboek en een laptop.
Nieuws14 augustus · 00:155 min leestijd

Writer lanceert Palmyra X6 en claimt 52 procent lagere kosten per agenttaak

Writer bouwde zijn nieuwe vlaggenschip Palmyra X6 op het Chinese open model GLM-5.2 en meet 52 procent lagere kosten per agenttaak. De tokenprijs ging juist omhoog, de winst zit in 38 procent minder tokens per taak.

Writer lanceert Palmyra X6, een vlaggenschipmodel voor bedrijven dat het natrainde op het Chinese open model GLM-5.2, en meet daarbij 52 procent lagere kosten per agenttaak.

Wie AI-agents in productie draait, betaalt niet per vraag maar per lus. Een agent plant, zoekt op, roept tools aan, controleert zichzelf en probeert het opnieuw, en elke ronde kost tokens. De gebruiker ziet één antwoord, de factuur telt de hele lus. Writer rekent daarom in kosten per afgeronde taak in plaats van prijs per miljoen tokens, en dat is precies de eenheid waarin een AI-budget uit de hand loopt. Eén detail maakt dat concreet: de tokenprijs van Palmyra X6 ging omhoog, niet omlaag.

Duurder per token, goedkoper per taak

Palmyra X6 rekent 2 dollar per miljoen invoertokens en 8 dollar per miljoen uitvoertokens, bij een contextvenster van 1 miljoen tokens. Voorganger X5 stond op 0,60 dollar per miljoen invoertokens. Toch valt de rekening per taak lager uit, want het model verbruikt volgens Writer 38 procent minder tokens per opdracht: de kosten per taak zakken van 0,25 naar 0,12 dollar en de mediane doorlooptijd van 50 naar 26 seconden, aldus Crypto Briefing.

Dat verandert waar je bij een offerte naar kijkt. Een lagere prijs per miljoen tokens zegt weinig als een model drie keer zo veel stappen nodig heeft om dezelfde taak af te maken. Hetzelfde patroon werd eerder zichtbaar toen de AI-rekening van Uber en Meta bleef stijgen terwijl de prijs per token juist daalde.

Het harnas doet het meeste werk, ook op andermans modellen

De interessantste claim gaat niet over het model. Writer zegt dat zijn vernieuwde agent-harnas, de laag die taken plant, werk in batches verdeelt en subagents aanstuurt, taken 44 procent sneller en 41 procent goedkoper afrondt op elk getest model, inclusief modellen van Anthropic en OpenAI. Het eigen model levert dus maar een deel van de winst. De orkestratielaag levert de rest, ongeacht wat eronder hangt.

Writer dekt zich daar ook zelf mee in. Beheerders kunnen in WRITER Agent voortaan modellen van Anthropic, OpenAI, Microsoft Azure, AWS Bedrock en Nvidia NIM aanzetten. Nieuw is verder een governancelaag: zicht op verbruik per team, analyses per playbook en skill, en waarschuwingen met harde uitgavenlimieten.

De cijfers komen van Writer zelf

Op negen interne evaluaties, van grounding en tool-gebruik tot delegatie aan subagents, haalt X6 gemiddeld 0,87 van 1,00, tegen 0,86 voor Claude Opus 4.8 en 0,80 voor GPT-5.5. Het prijsverschil is groter dan het scoreverschil: Opus 4.8 staat in het persbericht van Writer op 15 dollar invoer en 75 dollar uitvoer per miljoen tokens, waar X6 op 2 en 8 zit.

Grafiek van WRITER met de capaciteitsscore van Palmyra X6 afgezet tegen de kosten per miljoen uitvoertokens, naast Claude Opus 4.8, Claude Sonnet 4.6, GPT-5.5, Gemini 3.1 en Flash 3.5. (bron: WRITER)
Grafiek van WRITER met de capaciteitsscore van Palmyra X6 afgezet tegen de kosten per miljoen uitvoertokens, naast Claude Opus 4.8, Claude Sonnet 4.6, GPT-5.5, Gemini 3.1 en Flash 3.5. (bron: WRITER)

Dit zijn interne benchmarks van de partij die het model verkoopt, met een eigen protocol en een eigen evaluatieset. Onafhankelijke toetsing ontbreekt nog. May Habib, medeoprichter en CEO van Writer, zegt tegen TechCrunch dat bedrijven het najagen van de volgende benchmark spuugzat zijn. Dat is een eerlijke observatie, en het komt goed uit voor een leverancier die zijn eigen meetlat aanlegt.

Een Chinees open model onder een Amerikaans vlaggenschip

Palmyra X6 is niet vanaf nul getraind. Het is een nagetrainde versie van GLM-5.2, het open-weight mixture-of-experts-model van het Beijingse Z.ai, met 744 miljard parameters waarvan er ongeveer 40 miljard per token actief zijn. Writer erfde die architectuur ongewijzigd en zette er een opvallend kleine trainingsronde overheen: 626 gecureerde synthetische agenttrajecten, één epoch lang op een lage leersnelheid. Onderzoeksleider Dan Bikel zegt dat het bedrijf de getallen van het basismodel enkel als startpunt pakte en vanaf daar doortrainde.

Dat een Amerikaanse leverancier zijn vlaggenschip op Chinese gewichten bouwt, was twee jaar geleden ondenkbaar. Het volgt wel een bekend spoor: GLM-5.2 klopte GPT-5.5 op codeerbenchmarks voor een zesde van de prijs, en Databricks koos het als standaard codeermodel nadat het Opus 4.8 evenaarde voor 1,28 dollar per taak tegen 1,94. Nieuw is dat het model nu ónder een westers enterprise-product zit in plaats van ernaast.

De herkomst blijft wel een aandachtspunt. Writer zegt de gewichten via Hugging Face te hebben gehaald en alle training op Amerikaanse infrastructuur te hebben gedraaid, en publiceerde een risico-evaluatie met 19.674 beoordeelde antwoorden. Op de FORTRESS-veiligheidsbenchmark scoort X6 met zijn systeemprompt 8,6 punten hoger dan het kale basismodel. Dat is relevant, want SaferAI zag GLM-5.2 eerder geen enkele offensieve cyber- of biologietaak weigeren. Writer tekent zelf aan dat het gedrag per taal verschilt.

Waar de rekening echt wordt bepaald

De bruikbare les zit niet in dit model maar in de meetlat. Zolang je AI-uitgaven in prijs per miljoen tokens staan, mis je de helft van het verhaal: een agent die minder stappen nodig heeft is goedkoper dan een agent met een lagere tokenprijs. Goldman Sachs verwacht dat het tokenverbruik tussen 2026 en 2030 met een factor 24 stijgt, gedreven door agents die permanent aan staan, en dan is de rekenwijze geen boekhoudkundig detail meer.

De 41 procent die Writer op andermans modellen meet, is daarbij het interessantste getal. Dat deel zit in hoe agents zijn ingericht, niet in wie het model maakte, en het is dus ook het deel dat je kunt oogsten zonder van leverancier te wisselen.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Agents die minder tokens verstoken

Ik kijk met je mee naar wat je agents per afgeronde taak kosten en pak daarna het hele traject op, van meedenken en ontwerp tot bouwen en automatiseren, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

GLM-5.2 weigert in test van SaferAI geen enkele offensieve cyber- of biotaak
Nieuws
5 min

5 aug 04:11

GLM-5.2 weigert in test van SaferAI geen enkele offensieve cyber- of biotaak

Het Franse SaferAI mat GLM-5.2 langs de vier systeemrisico's van de EU-Gedragscode. Het Chinese open model weigerde geen enkele offensieve cyber- of biologietaak, terwijl Claude Opus 4.7 zo vaak weigerde dat een benchmark niet af kwam.

Moonshot lanceert Kimi K3, het grootste open AI-model ter wereld
Nieuws
4 min

18 jul 06:11

Moonshot lanceert Kimi K3, het grootste open AI-model ter wereld

Moonshot AI bracht Kimi K3 uit, met 2,8 biljoen parameters het grootste open-weight model ter wereld. De benchmarks zetten het vlak achter Claude en GPT, tegen een fractie van de prijs.

Microsoft vervangt OpenAI en kroont GPT-5.6 in dezelfde week: je AI-leverancier kiezen is de verkeerde vraag
Inzicht
8 min

11 jul 09:00

Microsoft vervangt OpenAI en kroont GPT-5.6 in dezelfde week: je AI-leverancier kiezen is de verkeerde vraag

In dezelfde week zette Microsoft eigen modellen in Excel om OpenAI-kosten te drukken en maakte het GPT-5.6 voorkeursmodel in Copilot. Geen tegenspraak, maar een strategie: zelfs de grootste inkoper kiest geen AI-leverancier, hij routeert per taak. Waarom welke leverancier de verkeerde vraag is.

Meta lanceert betaald Muse Spark 1.1 onder de prijs van Claude Opus
Nieuws
4 min

9 jul 18:14

Meta lanceert betaald Muse Spark 1.1 onder de prijs van Claude Opus

Meta brengt met Muse Spark 1.1 zijn eerste betaalde AI-model uit, gericht op coding-agents en geprijsd op een kwart van de invoerprijs van Claude Opus 4.8. Wat verandert dat voor jouw modelkeuze?

Bijgetraind open model klopt GPT en Claude op financiele taken, tegen een fractie van de kosten
Nieuws
5 min

4 jul 04:25

Bijgetraind open model klopt GPT en Claude op financiele taken, tegen een fractie van de kosten

Bridgewater en Thinking Machines Lab lieten een klein, zelf bijgetraind open model de duurste AI-modellen verslaan op echte financiele beoordelingstaken. Wat dat betekent voor je modelkeuze bij gevoelig werk.

Proton lanceert Lumo 2.0: privacy-chatbot moet ChatGPT en Copilot evenaren
Nieuws
4 min

1 jul 00:29

Proton lanceert Lumo 2.0: privacy-chatbot moet ChatGPT en Copilot evenaren

Proton lanceert Lumo 2.0, een flink krachtigere AI-chatbot die op Europese servers draait onder Zwitsers privacyrecht en zo een concreet, betaalbaar alternatief biedt voor ChatGPT en Copilot.