Beursgrafiek met candlesticks op een donker scherm
Nieuws4 juli · 04:255 min leestijd

Bijgetraind open model klopt GPT en Claude op financiele taken, tegen een fractie van de kosten

Bridgewater en Thinking Machines Lab lieten een klein, zelf bijgetraind open model de duurste AI-modellen verslaan op echte financiele beoordelingstaken. Wat dat betekent voor je modelkeuze bij gevoelig werk.

Een handvol alledaagse taken van beleggers, en de duurste AI-modellen ter wereld haalden er nauwelijks een voldoende. Dat is de kern van nieuw onderzoek van Thinking Machines Lab, het lab van ex-OpenAI-topvrouw Mira Murati, samen met de onderzoeksafdeling van hedgefonds Bridgewater. Toen ze GPT, Claude en Gemini zonder speciale instructies loslieten op zes financiele beoordelingstaken, bleef de gemiddelde nauwkeurigheid steken rond 47 procent, niet veel beter dan een muntworp. Een veel kleiner, open model dat ze zelf bijtrainden versloeg vervolgens elk vlaggenschipmodel, tegen ongeveer een veertiende van de kosten.

Het interessante zit niet in de score alleen, maar in wat het onthult over hoe je een AI-model kiest voor werk dat er echt toe doet. De juiste antwoorden op deze taken stonden namelijk nergens op het openbare internet. Ze zaten in het hoofd van ervaren beleggers. En precies daar lopen de algemene topmodellen vast.

Wat er precies getest is

De onderzoekers bouwden zes taken na uit de dagelijkse routine van een beleggingsteam. Een paar voorbeelden: bepalen of een nieuwsartikel relevant is voor de directie, herkennen of een document van een centrale bank hint op een komende renteverandering, en vaststellen waar in een lang document of een e-mail de standaardtekst begint. Geen trivia, maar de saaie, oordeelsgevoelige filterstappen waar een analist elke dag doorheen moet.

Tegen die taken zetten ze de zwaarste modellen van dit moment: Gemini 3.1 Pro, Claude Opus 4.6 en 4.8, en GPT 5.2, 5.4 en 5.5. Met een kale prompt kwam dat gezelschap gemiddeld niet verder dan 47,2 procent. Met zorgvuldig door experts geschreven prompts steeg het gemiddelde naar 78,2 procent, meteen ook de score van het beste model, Claude Opus 4.8. Daar liep het vast: meer prompt-engineering leverde nauwelijks nog winst op.

Bijtrainen versloeg prompt-engineering

In plaats van door te blijven sleutelen aan prompts, trainden de onderzoekers een open model bij: Qwen3-235B, met openbare gewichten, op hun eigen Tinker-platform. Dat model kwam uit op 84,7 procent gemiddeld, oftewel bijna 30 procent minder fouten dan het beste gesloten topmodel. En dat tegen een inferentiekostprijs die ongeveer 13,8 keer lager lag per taak. Bijtrainen is voor de meeste bedrijven trouwens niet de eerste stap, want daar gaat een goedkopere vraag aan vooraf: wanneer het loont om je bedrijfskennis met RAG doorzoekbaar te maken, en wanneer je het juist niet moet bouwen.

Gemiddelde nauwkeurigheid op zes financiele beoordelingstaken (bron: Thinking Machines Lab en Bridgewater)

De kostenkant is minstens zo leerzaam als de nauwkeurigheid. Meer betalen bracht namelijk lang niet altijd meer kwaliteit: GPT 5.4 was in deze test zo'n 43 procent duurder dan GPT 5.2, met maar een marginaal betere score. Simpelweg naar het nieuwste, duurste model grijpen loont dus niet vanzelf.

Waarom de dure modellen bleven steken

De verklaring die de onderzoekers geven, raakt de kern van waar generieke AI tegenaan loopt. Een prompt kan alleen de intuitie overbrengen die een expert in woorden weet te vatten, terwijl juist de oordelen die het meest tellen vaak het moeilijkst te verwoorden zijn. Een topmodel dat op het openbare internet is getraind heeft die stille, ervaringsgebonden kennis simpelweg nooit gezien, en je krijgt haar er met tekstinstructies ook niet volledig in. Dat verschil zit in de motor en niet in het merk op de knop: welke engine onder je AI-assistent draait bepaalt je rekening en je afhankelijkheid.

Slim was ook hoe ze aan trainingsdata kwamen zonder een fortuin aan dure experts uit te geven. Eerst lieten ze niet-gespecialiseerde krachten documenten labelen. Daarna zette een eerste model de eigen voorspellingen naast die labels en markeerde alleen de gevallen waar het van mening verschilde. Uitsluitend die betwiste gevallen gingen naar ervaren beleggers, die bepaalden of het om een echt lastig geval ging of om een verkeerd label. Zo blijft de duurste schakel, de expert, alleen ingezet waar het er toe doet.

Belangrijke kanttekening

Dit is onderzoek van Bridgewater en Thinking Machines Lab zelf, niet onafhankelijk gevalideerd, en de taken zijn specifiek voor hun eigen beleggingswerk. De cijfers zijn dus een sterk signaal, geen algemene wet. En het recept vraagt iets wat niet elk bedrijf in huis heeft: goede gelabelde voorbeelden en de capaciteit om een open model bij te trainen. Wie dat mist, blijft voorlopig aangewezen op slimme prompts en kant-en-klare modellen.

Tegelijk is de richting onmiskenbaar. Het is niet het eerste signaal die kant op: een open model als GLM-5.2, dat GPT-5.5 op programmeerwerk klopt tegen een zesde van de prijs, laat op een heel ander terrein hetzelfde patroon zien. Een goed gekozen, gericht ingezet open model verslaat een duur generalistmodel op een afgebakende taak.

Wat dit betekent voor jouw bedrijf

De les is niet dat topmodellen slecht zijn, maar dat het beste model afhangt van de taak. Voor open, algemene vragen blijft een vlaggenschip sterk. Maar voor een afgebakende, oordeelsgevoelige taak die leunt op jouw eigen kennis, denk aan het beoordelen van offertes, het filteren van dossiers of het herkennen van wat in een contract afwijkt, kan een kleiner, bijgetraind of self-hosted model nauwkeuriger en veel goedkoper zijn. Bovendien houd je gevoelige data dan in eigen hand in plaats van bij een externe leverancier. Reken die besparing wel helemaal door, want zelf hosten is niet automatisch goedkoper dan een cloud-API zodra je GPU-leegloop en beheer meetelt.

De praktische route ernaartoe is niet gokken op het duurste model, maar modellen vergelijken op kosten per taak in plaats van per token, met een eigen mini-benchmark op je echte werk. Wie dat doet ontdekt vaak hetzelfde als Bridgewater: het model dat op papier het sterkst lijkt, is niet automatisch het model dat jouw specifieke werk het best en het goedkoopst doet.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Het juiste model voor jouw taak

Ik help je het AI-model kiezen dat past bij jouw specifieke werk, van meedenken en een eerlijke mini-benchmark op je echte data tot bijtrainen, koppelen en self-hosted draaien waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Proton lanceert Lumo 2.0: privacy-chatbot moet ChatGPT en Copilot evenaren
Nieuws
4 min

1 jul 00:29

Proton lanceert Lumo 2.0: privacy-chatbot moet ChatGPT en Copilot evenaren

Proton lanceert Lumo 2.0, een flink krachtigere AI-chatbot die op Europese servers draait onder Zwitsers privacyrecht en zo een concreet, betaalbaar alternatief biedt voor ChatGPT en Copilot.

Writer lanceert Palmyra X6 en claimt 52 procent lagere kosten per agenttaak
Nieuws
5 min

14 aug 00:15

Writer lanceert Palmyra X6 en claimt 52 procent lagere kosten per agenttaak

Writer bouwde zijn nieuwe vlaggenschip Palmyra X6 op het Chinese open model GLM-5.2 en meet 52 procent lagere kosten per agenttaak. De tokenprijs ging juist omhoog, de winst zit in 38 procent minder tokens per taak.

Onderzoekers lezen verborgen AI-redeneringen uit en vinden 182 credentials in publieke logs
Nieuws
5 min

11 aug 20:24

Onderzoekers lezen verborgen AI-redeneringen uit en vinden 182 credentials in publieke logs

Onderzoekers van de Universiteit Tübingen en Snyk ontcijferden de verborgen denkstappen van Claude, GPT en Gemini via de API's zelf. In publieke agent-logs vonden ze 62 API-sleutels en 33 wachtwoorden.

Thinking Machines lanceert open-weight model Inkling met 975 miljard parameters
Nieuws
4 min

15 jul 22:10

Thinking Machines lanceert open-weight model Inkling met 975 miljard parameters

Thinking Machines Lab, het bedrijf van Mira Murati, brengt open-weight model Inkling uit: 975 miljard parameters, vrij te downloaden. Wat dat betekent voor een Nederlandse organisatie die self-hosted AI afweegt tegen vendor lock-in.

Meta lanceert betaald Muse Spark 1.1 onder de prijs van Claude Opus
Nieuws
4 min

9 jul 18:14

Meta lanceert betaald Muse Spark 1.1 onder de prijs van Claude Opus

Meta brengt met Muse Spark 1.1 zijn eerste betaalde AI-model uit, gericht op coding-agents en geprijsd op een kwart van de invoerprijs van Claude Opus 4.8. Wat verandert dat voor jouw modelkeuze?

DeepSeek brengt V4-Pro uit preview en houdt de tarieven gelijk
Nieuws
5 min

13 aug 06:10

DeepSeek brengt V4-Pro uit preview en houdt de tarieven gelijk

DeepSeek zet V4-Pro als officiële versie op zijn API, onder dezelfde modelnaam en tegen hetzelfde tarief. Er kwam geen aankondiging bij, de gewichten blijven voorlopig de preview en de aangekondigde prijsverhoging staat nog op dezelfde pagina.