Iemand in pak schrijft in een notitieblok terwijl een gestempeld officieel document op het bureau ligt.
Nieuws21 augustus · 18:115 min leestijd

Harvey traint eigen juridisch model op het open Chinese Kimi K3

Harvey post-traint zijn eerste eigen juridische model op het open-weight Kimi K3 van Moonshot in plaats van een frontier-API te huren. Wat de cijfers laten zien en wat die route echt kost.

Harvey, het juridische AI-bedrijf dat op elf miljard dollar wordt gewaardeerd, traint zijn eerste eigen model niet op een gehuurd topmodel maar op open Chinese gewichten. Harvey Tenet is een Kimi K3-basis die het bedrijf samen met Fireworks post-trainde voor langlopend juridisch werk, staat in een onderzoeksupdate van donderdag.

Daarmee wordt de bouw-of-huurvraag concreter dan een prijslijst hem ooit maakt. Voor een kantoor of softwarebedrijf dat met eigen domeindata werkt, leek de keuze lang binair: een gesloten topmodel per token afnemen, of zelf iets kleins finetunen dat op echt werk niet meekomt. Harvey laat een derde route zien die op de zwaarste juridische benchmarks standhoudt, en zet de rekening erbij. Die rekening is precies het deel dat je leest voordat je dit natrekt.

Wat Tenet is

Tenet is geen model dat vanaf nul is gebouwd. Harvey begon bij de gewichten van Kimi K3, het open model van het Chinese Moonshot, en trainde daar bovenop met asynchrone reinforcement learning in nagebootste kantoorsituaties. Elke trainingstaak bestaat uit een opdracht zoals een partner die zou geven, een dossier met zowel kerndocumenten als ruis, en een expertrubriek met gemiddeld vijftig criteria die elk simpelweg gehaald of niet gehaald zijn. Eén doorloop kan meer dan duizend beurten duren.

De omvang van die operatie is het eerste eerlijke signaal. Harvey trainde met een LoRA van rang 64 over het volledige K3-netwerk, op ongeveer 1.750 juridische taakomgevingen, op zo'n 150 Nvidia B300-versnellers, twee maanden lang. Klantdata zegt het bedrijf daarbij niet te hebben gebruikt.

De cijfers

Op LAB, Harvey's eigen open benchmark van meer dan 1.200 langlopende juridische taken, voltooit Tenet bijna twee keer zo veel taken die het tijdens de training niet zag als de kale Kimi K3-basis, met een all-pass-rate die 9 procentpunt hoger ligt. Op LAB Contracts gaat het om 20 procent meer voltooide taken en 2 procentpunt meer all-pass. Dat is volgens Harvey de beste score tot nu toe op LAB Contracts en een tweede plaats op LAB. De winst kwam er zonder dat de kosten per taak opliepen: in de training werd zuinig gereedschapsgebruik beloond, zodat het model bij gelijke kwaliteit minder tokens verbruikt.

Grafiek met de kosten per taak tegen de all pass rate op de LAB-benchmark. Het zwarte punt Harvey ligt fors boven het open punt Kimi K3 bij vergelijkbare kosten per taak, terwijl modellen als Fable 5 en Opus 4.8 lager scoren tegen hogere kosten. Bron: Harvey
Grafiek met de kosten per taak tegen de all pass rate op de LAB-benchmark. Het zwarte punt Harvey ligt fors boven het open punt Kimi K3 bij vergelijkbare kosten per taak, terwijl modellen als Fable 5 en Opus 4.8 lager scoren tegen hogere kosten. Bron: Harvey

Belangrijker dan de scores is waar ze vandaan komen. De grootste sprongen zitten niet in het basismodel, maar in wat Harvey eromheen bouwde. Bij due diligence, waar één taak tot 80 miljoen tokens aan documenten omvat, haalde geen enkel referentiemodel meer dan 43,8 procent van de rubriekcriteria. Met een andere agentopzet en zelfdistillatie op een GLM-5.2-orkestrator kwam dat op 60,1 procent. Bij zoeken in de opgebouwde kennis van een kantoor daalde het tokengebruik met 58 procent en de kosten per vraag met 90 procent, en steeg wat Harvey intelligentie per token noemt naar 190,8 tegen 129,3 voor de beste frontier-opstelling.

Wat een Nederlands kantoor hieruit kan halen

De verleiding is om te lezen dat open gewichten nu gratis topkwaliteit opleveren. Dat staat er niet. Harvey kocht die kwaliteit met juristen die dossiers en beoordelingsrubrieken schreven, met een trainingspartner, en met twee maanden rekentijd op 150 versnellers. Het overdraagbare deel is het eerste. Beoordeelde eigen data en een scherpe definitie van goed werk wegen zwaarder dan de keuze van het basismodel.

De praktische grenzen blijven ook gewoon staan. De gewichten van Kimi K3 beslaan in 4-bits formaat ongeveer 1,4 terabyte en vragen 64 of meer versnellers, dus zelf draaien is voor vrijwel elk Nederlands bedrijf geen reële optie en betekent in de praktijk een andere leverancier. Het omslagpunt tussen zelf hosten en een cloud-API zit bovendien in vier kostenlagen, niet in de prijs per miljoen tokens. En Tenet draait nog niet in het product van Harvey; een datum noemt het bedrijf niet.

De richting

Harvey richtte zich eerder op het aanpassen van gesloten modellen van OpenAI, Anthropic en Google voor juridisch gebruik, dus de stap naar Chinese open gewichten breekt met de eigen praktijk. Weglopen bij die leveranciers doet het bedrijf niet: medeoprichter Gabe Pereyra zegt dat Tenet klanten een extra optie geeft in de mix waarlangs Harvey taken al naar verschillende modellen stuurt, en hij wil van Tenet uiteindelijk een startpunt maken waarop kantoren hun eigen versie trainen.

Dat sluit aan op een beweging die al zichtbaar werd toen Microsoft onderzocht of K3 Copilot-functies kan overnemen en daarmee tot 600 miljoen dollar aan inferentiekosten kan schelen. Het verschil is dat Harvey niet overstapt naar een goedkoper model, maar er iets van zichzelf van maakt. Wie zijn voorsprong in dossiers en vakkennis heeft zitten, hoeft die niet langer bij een modelleverancier onder te brengen om er een agent op te kunnen zetten. Dat is de verschuiving waar deze aankondiging over gaat, en ze raakt elk domein waar het werk zit in materiaal dat alleen jouw mensen goed kunnen beoordelen.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Jouw kennis, jouw model

Het verschil zat bij Harvey niet in het basismodel maar in de eigen dossiers en de rubrieken die vastleggen wat goed werk is. Ik denk met je mee waar die waarde in jouw organisatie zit, ontwerp de aanpak en bouw en automatiseer hem ook echt, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Onderzoekers lezen verborgen AI-redeneringen uit en vinden 182 credentials in publieke logs
Nieuws
5 min

11 aug 20:24

Onderzoekers lezen verborgen AI-redeneringen uit en vinden 182 credentials in publieke logs

Onderzoekers van de Universiteit Tübingen en Snyk ontcijferden de verborgen denkstappen van Claude, GPT en Gemini via de API's zelf. In publieke agent-logs vonden ze 62 API-sleutels en 33 wachtwoorden.

Anthropic beconcurreert zijn partners, klanten wijken uit naar open modellen
Nieuws
5 min

29 jul 04:15

Anthropic beconcurreert zijn partners, klanten wijken uit naar open modellen

Oprichters en softwarebestuurders stappen over op goedkopere open modellen uit wantrouwen jegens Anthropic, meldt The Wall Street Journal. Aanleiding: een eigen designtool die de markt van partner Figma raakt, plus een bewaarbeleid dat gevoelige sectoren afschrikt.

Washington, Beijing en Stripe grijpen alledrie naar dezelfde laag
Signaal
7 min

27 jul 12:04

Washington, Beijing en Stripe grijpen alledrie naar dezelfde laag

In tien dagen greep iedereen naar dezelfde laag in de AI-keten, en dat was niet het model. Het schaarse goed blijkt de capaciteit om een model te serveren, en daar verschuift de macht nu naartoe.

Moonshot publiceert de gewichten van Kimi K3 vandaag om 17.00 uur
Nieuws
4 min

27 jul 08:15

Moonshot publiceert de gewichten van Kimi K3 vandaag om 17.00 uur

Moonshot zet de gewichten van Kimi K3 vandaag om 17.00 uur op Hugging Face. Wat er dan vrijkomt, waarom de licentie nog ontbreekt en hoeveel hardware zelf draaien echt vraagt.

Moonshot lanceert Kimi K3, het grootste open AI-model ter wereld
Nieuws
4 min

18 jul 06:11

Moonshot lanceert Kimi K3, het grootste open AI-model ter wereld

Moonshot AI bracht Kimi K3 uit, met 2,8 biljoen parameters het grootste open-weight model ter wereld. De benchmarks zetten het vlak achter Claude en GPT, tegen een fractie van de prijs.

Open modellen halen 62 procent van het tokenverkeer op Vercels AI Gateway
Nieuws
5 min

24 aug 02:11

Open modellen halen 62 procent van het tokenverkeer op Vercels AI Gateway

Op 22 augustus liep 62 procent van alle tokens op Vercels AI Gateway over open modellen, tegen 28,4 procent in juni. De uitgaven volgen die verschuiving niet: daar houdt Anthropic de meerderheid vast.