Close-up van een losse grafische kaart, zilverkleurig met zichtbare koelvinnen.
Nieuws31 juli · 04:114 min leestijd

Thinking Machines brengt Inkling Small uit met een kwart van de parameters

Thinking Machines Lab brengt Inkling Small uit: 276 miljard parameters, een kwart van Inkling, met vrijwel dezelfde prestaties. Zelf draaien vraagt nu 180 GB videogeheugen in plaats van 600 GB.

Thinking Machines Lab bracht op 30 juli Inkling Small uit, een open-weight model van 276 miljard parameters dat volgens het bedrijf dicht in de buurt komt van het vier keer zo grote Inkling.

Het verschil zit in de machine eronder. Om Inkling, het model van 975 miljard parameters dat het bedrijf twee weken eerder vrijgaf, zelf te draaien heb je in gekwantiseerde NVFP4-vorm ongeveer 600 GB videogeheugen nodig, oftewel acht H200-kaarten. Voor Inkling Small zakt dat naar 180 GB, twee H200's of één B300. De prijs per miljoen uitvoertokens volgt dezelfde lijn: in de kostenvergelijking van het bedrijf 1,20 dollar, tegen 4,05 dollar voor het grote model.

Beter op code en redeneren, zwakker op parate kennis

Op de tests die Thinking Machines zelf publiceert wint het kleine model op de meeste onderdelen van zijn grote broer. Op de codeer-benchmark SWEBench Verified scoort Inkling Small 80,2 procent tegen 77,6 procent, op GPQA Diamond 89,5 tegen 87,2 procent en op Humanity's Last Exam 31,6 tegen 29,7 procent. Alleen op de wiskundeolympiade-set AIME 2026 blijft het grote model voor, met 97,1 tegen 95,5 procent. Van de 276 miljard parameters zijn er per token maar 12 miljard actief, tegen 41 miljard bij Inkling.

Meetbureau Artificial Analysis komt op hetzelfde beeld uit. Inkling Small haalt 40 punten op de Intelligence Index, één punt onder Inkling, met minder dan een derde van de parameters. Er is één duidelijke zwakte: op parate feitenkennis zakt het kleine model naar 31 procent correcte antwoorden, tegen 40 procent voor Inkling. Voor een toepassing die eerst in je eigen documenten zoekt en de feiten dus zelf aanlevert, weegt dat licht. Voor een assistent die uit het hoofd moet antwoorden, weegt dat zwaar.

Wat dit doet met de rekensom van zelf hosten

De gewichten staan onder de Apache 2.0-licentie op Hugging Face, samen met een zuinigere NVFP4-variant, en het model is bij te trainen via Tinker, het betaalde platform waar Thinking Machines zijn geld mee verdient. Commercieel gebruik is daarmee vrij. De rekening zit in het ijzer eronder.

Een NVIDIA H100 datacenter-GPU wordt uit een testopstelling gehaald. Bron: 极客湾Geekerwan / Wikimedia Commons (CC BY 3.0)
Een NVIDIA H100 datacenter-GPU wordt uit een testopstelling gehaald. Bron: 极客湾Geekerwan / Wikimedia Commons (CC BY 3.0)

Twee H200-kaarten zijn nog altijd geen kantoorserver: reken op tienduizenden euro's aan hardware, of op huur per uur bij een GPU-aanbieder. Het omslagpunt waarop eigen ijzer goedkoper wordt dan een open-weight API ligt pas rond de 15 tot 20 miljoen tokens per dag, een volume dat de meeste Nederlandse bedrijven bij lange na niet halen. Wat wel verandert, is de drempel. Een organisatie die om dataresidentie of privacy zelf wil draaien, hoeft daar geen cluster van acht kaarten meer voor vrij te maken, en een fine-tune op eigen data past nu op hardware die je nog kunt overzien.

De open-modelrace gaat over efficiëntie, niet over omvang

Twee weken tussen een model van 975 miljard parameters en eentje van 276 miljard dat er nauwelijks voor onderdoet: dat tempo zegt iets over waar de winst nu zit. Niet in meer parameters, maar in hoeveel er per token echt aan het werk gaan. Inkling Small heeft bovendien iets minder uitvoertokens nodig per taak dan Inkling zelf, terwijl modellen op hetzelfde intelligentieniveau er doorgaans fors meer verstoken.

Daarmee verschuift het criterium waarop je een open-weight model kiest. Niet de plek op een ranglijst bepaalt je kosten, maar wat een model per afgeronde taak aan rekenkracht en tokens opsoupeert. Dat is precies waarom een eigen mini-benchmark op je eigen taken zwaarder weegt dan een algemene ranglijst. Thinking Machines verdient niets aan het model zelf: hoe kleiner en goedkoper het te draaien is, hoe meer partijen het gaan fijnslijpen op Tinker. Die prikkel wijst voor het eerst in een tijd dezelfde kant op als het belang van de bedrijven die het model gebruiken.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Zelf AI draaien, goed doordacht

Of een open model op eigen hardware nu slim is of niet, die afweging maak ik graag met je: ik denk mee over de keuze, ontwerp de oplossing en bouw hem ook echt, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

Qwen3.8-27B evenaart GPT-5.6 Luna in onafhankelijke meting
Nieuws
5 min

18 aug 06:23

Qwen3.8-27B evenaart GPT-5.6 Luna in onafhankelijke meting

Benchmarkbureau Artificial Analysis geeft Qwen3.8-27B een 52, gelijk aan GPT-5.6 Luna. Het model past in 17 GB op een enkele videokaart, maar verbruikt 160 miljoen tokens waar de mediaan op 43 miljoen ligt.

Alibaba wil omzetdeling vragen voor de volgende open-source Qwen
Nieuws
4 min

7 aug 04:10

Alibaba wil omzetdeling vragen voor de volgende open-source Qwen

Alibaba wil grote gebruikers van de volgende open-source Qwen een deel van hun omzet laten afdragen, meldt Reuters. Het sjabloon staat al in de licentie van Kimi K3: boven 20 miljoen dollar omzet volgt een aparte overeenkomst.

Amerikaanse AI splitst in twee lagen, en de NSA trekt de grens
Signaal
7 min

2 aug 00:02

Amerikaanse AI splitst in twee lagen, en de NSA trekt de grens

Westerse labs publiceren meer modelgewichten dan ooit, terwijl hun topmodellen eerst naar Washington gaan. Sinds Executive Order 14409 loopt er een geheime NSA-drempel tussen die twee lagen.

IFM geeft zes AI-modellen vrij met trainingscode en pre-trainingsdata
Nieuws
5 min

3 sep 18:36

IFM geeft zes AI-modellen vrij met trainingscode en pre-trainingsdata

Het Abu Dhabi-instituut IFM geeft zes AI-modellen van 0,9 tot 375 miljard parameters vrij met trainingscode en pre-trainingscorpus. Op de modelkaarten wijkt de licentie op een punt af van het persbericht.

Tencent zet Hy4 preview open onder Apache 2.0 zonder uitgesloten gebieden
Nieuws
5 min

28 aug 12:07

Tencent zet Hy4 preview open onder Apache 2.0 zonder uitgesloten gebieden

Tencent zet Hy4 preview open onder Apache 2.0 zonder uitgesloten gebieden. Het licentiebestand is schoon en er is geen toegangsformulier, maar met 1,56 terabyte aan gewichten blijft zelf hosten uitgesloten en verschuift de keuze naar de API.

Alibaba zet Qwen3.8-Flash-Next open en rekent 0,16 dollar per miljoen tokens
Nieuws
5 min

27 aug 02:22

Alibaba zet Qwen3.8-Flash-Next open en rekent 0,16 dollar per miljoen tokens

Alibaba zet de gewichten van Qwen3.8-Flash-Next open. Het model activeert 6 van 176 miljard parameters per token, kost gehost 0,16 dollar per miljoen invoertokens en komt met een strakkere licentie dan het vlaggenschip.