Harvey, het juridische AI-bedrijf dat op elf miljard dollar wordt gewaardeerd, traint zijn eerste eigen model niet op een gehuurd topmodel maar op open Chinese gewichten. Harvey Tenet is een Kimi K3-basis die het bedrijf samen met Fireworks post-trainde voor langlopend juridisch werk, staat in een onderzoeksupdate van donderdag.
Daarmee wordt de bouw-of-huurvraag concreter dan een prijslijst hem ooit maakt. Voor een kantoor of softwarebedrijf dat met eigen domeindata werkt, leek de keuze lang binair: een gesloten topmodel per token afnemen, of zelf iets kleins finetunen dat op echt werk niet meekomt. Harvey laat een derde route zien die op de zwaarste juridische benchmarks standhoudt, en zet de rekening erbij. Die rekening is precies het deel dat je leest voordat je dit natrekt.
Wat Tenet is
Tenet is geen model dat vanaf nul is gebouwd. Harvey begon bij de gewichten van Kimi K3, het open model van het Chinese Moonshot, en trainde daar bovenop met asynchrone reinforcement learning in nagebootste kantoorsituaties. Elke trainingstaak bestaat uit een opdracht zoals een partner die zou geven, een dossier met zowel kerndocumenten als ruis, en een expertrubriek met gemiddeld vijftig criteria die elk simpelweg gehaald of niet gehaald zijn. Eén doorloop kan meer dan duizend beurten duren.
De omvang van die operatie is het eerste eerlijke signaal. Harvey trainde met een LoRA van rang 64 over het volledige K3-netwerk, op ongeveer 1.750 juridische taakomgevingen, op zo'n 150 Nvidia B300-versnellers, twee maanden lang. Klantdata zegt het bedrijf daarbij niet te hebben gebruikt.
De cijfers
Op LAB, Harvey's eigen open benchmark van meer dan 1.200 langlopende juridische taken, voltooit Tenet bijna twee keer zo veel taken die het tijdens de training niet zag als de kale Kimi K3-basis, met een all-pass-rate die 9 procentpunt hoger ligt. Op LAB Contracts gaat het om 20 procent meer voltooide taken en 2 procentpunt meer all-pass. Dat is volgens Harvey de beste score tot nu toe op LAB Contracts en een tweede plaats op LAB. De winst kwam er zonder dat de kosten per taak opliepen: in de training werd zuinig gereedschapsgebruik beloond, zodat het model bij gelijke kwaliteit minder tokens verbruikt.

Belangrijker dan de scores is waar ze vandaan komen. De grootste sprongen zitten niet in het basismodel, maar in wat Harvey eromheen bouwde. Bij due diligence, waar één taak tot 80 miljoen tokens aan documenten omvat, haalde geen enkel referentiemodel meer dan 43,8 procent van de rubriekcriteria. Met een andere agentopzet en zelfdistillatie op een GLM-5.2-orkestrator kwam dat op 60,1 procent. Bij zoeken in de opgebouwde kennis van een kantoor daalde het tokengebruik met 58 procent en de kosten per vraag met 90 procent, en steeg wat Harvey intelligentie per token noemt naar 190,8 tegen 129,3 voor de beste frontier-opstelling.
Wat een Nederlands kantoor hieruit kan halen
De verleiding is om te lezen dat open gewichten nu gratis topkwaliteit opleveren. Dat staat er niet. Harvey kocht die kwaliteit met juristen die dossiers en beoordelingsrubrieken schreven, met een trainingspartner, en met twee maanden rekentijd op 150 versnellers. Het overdraagbare deel is het eerste. Beoordeelde eigen data en een scherpe definitie van goed werk wegen zwaarder dan de keuze van het basismodel.
De praktische grenzen blijven ook gewoon staan. De gewichten van Kimi K3 beslaan in 4-bits formaat ongeveer 1,4 terabyte en vragen 64 of meer versnellers, dus zelf draaien is voor vrijwel elk Nederlands bedrijf geen reële optie en betekent in de praktijk een andere leverancier. Het omslagpunt tussen zelf hosten en een cloud-API zit bovendien in vier kostenlagen, niet in de prijs per miljoen tokens. En Tenet draait nog niet in het product van Harvey; een datum noemt het bedrijf niet.
De richting
Harvey richtte zich eerder op het aanpassen van gesloten modellen van OpenAI, Anthropic en Google voor juridisch gebruik, dus de stap naar Chinese open gewichten breekt met de eigen praktijk. Weglopen bij die leveranciers doet het bedrijf niet: medeoprichter Gabe Pereyra zegt dat Tenet klanten een extra optie geeft in de mix waarlangs Harvey taken al naar verschillende modellen stuurt, en hij wil van Tenet uiteindelijk een startpunt maken waarop kantoren hun eigen versie trainen.
Dat sluit aan op een beweging die al zichtbaar werd toen Microsoft onderzocht of K3 Copilot-functies kan overnemen en daarmee tot 600 miljoen dollar aan inferentiekosten kan schelen. Het verschil is dat Harvey niet overstapt naar een goedkoper model, maar er iets van zichzelf van maakt. Wie zijn voorsprong in dossiers en vakkennis heeft zitten, hoeft die niet langer bij een modelleverancier onder te brengen om er een agent op te kunnen zetten. Dat is de verschuiving waar deze aankondiging over gaat, en ze raakt elk domein waar het werk zit in materiaal dat alleen jouw mensen goed kunnen beoordelen.
Veelgestelde vragen
Jouw kennis, jouw model
Het verschil zat bij Harvey niet in het basismodel maar in de eigen dossiers en de rubrieken die vastleggen wat goed werk is. Ik denk met je mee waar die waarde in jouw organisatie zit, ontwerp de aanpak en bouw en automatiseer hem ook echt, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
