Writer lanceert Palmyra X6, een vlaggenschipmodel voor bedrijven dat het natrainde op het Chinese open model GLM-5.2, en meet daarbij 52 procent lagere kosten per agenttaak.
Wie AI-agents in productie draait, betaalt niet per vraag maar per lus. Een agent plant, zoekt op, roept tools aan, controleert zichzelf en probeert het opnieuw, en elke ronde kost tokens. De gebruiker ziet één antwoord, de factuur telt de hele lus. Writer rekent daarom in kosten per afgeronde taak in plaats van prijs per miljoen tokens, en dat is precies de eenheid waarin een AI-budget uit de hand loopt. Eén detail maakt dat concreet: de tokenprijs van Palmyra X6 ging omhoog, niet omlaag.
Duurder per token, goedkoper per taak
Palmyra X6 rekent 2 dollar per miljoen invoertokens en 8 dollar per miljoen uitvoertokens, bij een contextvenster van 1 miljoen tokens. Voorganger X5 stond op 0,60 dollar per miljoen invoertokens. Toch valt de rekening per taak lager uit, want het model verbruikt volgens Writer 38 procent minder tokens per opdracht: de kosten per taak zakken van 0,25 naar 0,12 dollar en de mediane doorlooptijd van 50 naar 26 seconden, aldus Crypto Briefing.
Dat verandert waar je bij een offerte naar kijkt. Een lagere prijs per miljoen tokens zegt weinig als een model drie keer zo veel stappen nodig heeft om dezelfde taak af te maken. Hetzelfde patroon werd eerder zichtbaar toen de AI-rekening van Uber en Meta bleef stijgen terwijl de prijs per token juist daalde.
Het harnas doet het meeste werk, ook op andermans modellen
De interessantste claim gaat niet over het model. Writer zegt dat zijn vernieuwde agent-harnas, de laag die taken plant, werk in batches verdeelt en subagents aanstuurt, taken 44 procent sneller en 41 procent goedkoper afrondt op elk getest model, inclusief modellen van Anthropic en OpenAI. Het eigen model levert dus maar een deel van de winst. De orkestratielaag levert de rest, ongeacht wat eronder hangt.
Writer dekt zich daar ook zelf mee in. Beheerders kunnen in WRITER Agent voortaan modellen van Anthropic, OpenAI, Microsoft Azure, AWS Bedrock en Nvidia NIM aanzetten. Nieuw is verder een governancelaag: zicht op verbruik per team, analyses per playbook en skill, en waarschuwingen met harde uitgavenlimieten.
De cijfers komen van Writer zelf
Op negen interne evaluaties, van grounding en tool-gebruik tot delegatie aan subagents, haalt X6 gemiddeld 0,87 van 1,00, tegen 0,86 voor Claude Opus 4.8 en 0,80 voor GPT-5.5. Het prijsverschil is groter dan het scoreverschil: Opus 4.8 staat in het persbericht van Writer op 15 dollar invoer en 75 dollar uitvoer per miljoen tokens, waar X6 op 2 en 8 zit.

Dit zijn interne benchmarks van de partij die het model verkoopt, met een eigen protocol en een eigen evaluatieset. Onafhankelijke toetsing ontbreekt nog. May Habib, medeoprichter en CEO van Writer, zegt tegen TechCrunch dat bedrijven het najagen van de volgende benchmark spuugzat zijn. Dat is een eerlijke observatie, en het komt goed uit voor een leverancier die zijn eigen meetlat aanlegt.
Een Chinees open model onder een Amerikaans vlaggenschip
Palmyra X6 is niet vanaf nul getraind. Het is een nagetrainde versie van GLM-5.2, het open-weight mixture-of-experts-model van het Beijingse Z.ai, met 744 miljard parameters waarvan er ongeveer 40 miljard per token actief zijn. Writer erfde die architectuur ongewijzigd en zette er een opvallend kleine trainingsronde overheen: 626 gecureerde synthetische agenttrajecten, één epoch lang op een lage leersnelheid. Onderzoeksleider Dan Bikel zegt dat het bedrijf de getallen van het basismodel enkel als startpunt pakte en vanaf daar doortrainde.
Dat een Amerikaanse leverancier zijn vlaggenschip op Chinese gewichten bouwt, was twee jaar geleden ondenkbaar. Het volgt wel een bekend spoor: GLM-5.2 klopte GPT-5.5 op codeerbenchmarks voor een zesde van de prijs, en Databricks koos het als standaard codeermodel nadat het Opus 4.8 evenaarde voor 1,28 dollar per taak tegen 1,94. Nieuw is dat het model nu ónder een westers enterprise-product zit in plaats van ernaast.
De herkomst blijft wel een aandachtspunt. Writer zegt de gewichten via Hugging Face te hebben gehaald en alle training op Amerikaanse infrastructuur te hebben gedraaid, en publiceerde een risico-evaluatie met 19.674 beoordeelde antwoorden. Op de FORTRESS-veiligheidsbenchmark scoort X6 met zijn systeemprompt 8,6 punten hoger dan het kale basismodel. Dat is relevant, want SaferAI zag GLM-5.2 eerder geen enkele offensieve cyber- of biologietaak weigeren. Writer tekent zelf aan dat het gedrag per taal verschilt.
Waar de rekening echt wordt bepaald
De bruikbare les zit niet in dit model maar in de meetlat. Zolang je AI-uitgaven in prijs per miljoen tokens staan, mis je de helft van het verhaal: een agent die minder stappen nodig heeft is goedkoper dan een agent met een lagere tokenprijs. Goldman Sachs verwacht dat het tokenverbruik tussen 2026 en 2030 met een factor 24 stijgt, gedreven door agents die permanent aan staan, en dan is de rekenwijze geen boekhoudkundig detail meer.
De 41 procent die Writer op andermans modellen meet, is daarbij het interessantste getal. Dat deel zit in hoe agents zijn ingericht, niet in wie het model maakte, en het is dus ook het deel dat je kunt oogsten zonder van leverancier te wisselen.
Veelgestelde vragen
Agents die minder tokens verstoken
Ik kijk met je mee naar wat je agents per afgeronde taak kosten en pak daarna het hele traject op, van meedenken en ontwerp tot bouwen en automatiseren, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
