Close-up van een Nvidia GeForce RTX-videokaart
Nieuws11 augustus · 16:105 min leestijd

Nvidia geeft agentmodel Nemotron 3.5 Lightning vrij met een modelrouter erbij

Nvidia publiceert de gewichten van agentmodel Nemotron 3.5 Lightning onder OpenMDW-1.1, een licentie zonder gebruiksbeperkingen, en levert er een routeerlaag bij die in LangChains test 74 procent van de kosten wegneemt.

Nvidia brengt Nemotron 3.5 Lightning uit, een open agentmodel van 30 miljard parameters waarvan er 3 miljard per token actief zijn, en publiceert de gewichten, de trainingsdata en de trainingsrecepten op Hugging Face.

Het model is niet bedoeld om je slimste model te vervangen, maar om het uitvoerende werk eronder over te nemen: tools aanroepen, uitkomsten controleren, subagents aansturen. Daar loopt de tokenrekening op. Nvidia levert er daarom meteen een routeerlaag bij, NeMo Switchyard, en in LangChains test daarmee ging 7 procent van de aanroepen naar Claude Opus 4.8 en de rest naar Lightning, met 74 procent lagere kosten dan wanneer alles naar het topmodel gaat. Voor een Nederlands bedrijf dat vandaag per token afrekent bij een API verschuift de vraag daarmee van welk model het slimst is naar welke stappen niet naar het dure model hoeven.

De licentie legt geen enkele gebruiksbeperking op

Het LICENSE-bestand in de repository is de onveranderde tekst van OpenMDW-1.1. Die geeft toestemming om zonder beperking met het model te handelen, onder auteursrecht, octrooirecht, databankrecht en bedrijfsgeheim. Er staat geen uitsluiting van de EU in, geen omzetgrens en geen lijst met verboden toepassingen, en de download zit niet achter een goedkeuringsformulier. Wie de bestanden zelf verder verspreidt hoeft alleen een kopie van de licentie en de herkomstvermeldingen mee te leveren. Over wat het model produceert legt de tekst expliciet niets op.

Een clausule is het lezen waard. Begin je een octrooi- of auteursrechtzaak over het model, dan vervallen al je rechten eronder, tenzij je zelf eerst was aangeklaagd. Verder noemt de modelkaart geen aanvullende voorwaarden: OpenMDW-1.1 is de enige geldende tekst.

Dat is minder beperkend dan bij Meta's agentmodel Muse Glimmer, dat een dag eerder onder onveranderde Apache 2.0 verscheen maar een aparte usage policy meekreeg die militair gebruik en het bedienen van kritieke infrastructuur verbiedt. Dat het addertje in de licentietekst zit en niet in de modelkaart bleek eind juli nog bij MiniMax, dat de gewichten van videomodel H3 online zette maar de EU als Excluded Territory uitsloot.

Snel, niet het slimst

Op de benchmarks die Nvidia zelf publiceert verliest Lightning van Qwen 3.6 35B A3B, een open model in dezelfde gewichtsklasse. Op SWE-bench Verified scoort het 51,56 tegen 70,12, op Terminal-Bench 2.1 24,58 tegen 44,38 en op MMLU Pro 81,94 tegen 85,63. Instructies opvolgen gaat wel beter: op IFBench 71,88 tegen 63,71.

De winst moet uit snelheid komen. Nvidia claimt tot vier keer meer uitvoersnelheid dan modellen van vergelijkbare grootte, en op PinchBench 86 procent nauwkeurigheid terwijl het 10.000 taken 30 procent sneller afrondt dan Qwen 3.6 35B. Alle cijfers komen uit Nvidia's eigen testopstelling, niet van een onafhankelijke partij.

Staafdiagram van Nvidia met de nauwkeurigheid van Nemotron 3.5 Lightning tegenover Nemotron 3 Nano, Qwen 3.6 35B en Gemma 4 26B op zes benchmarks. Bron: Nvidia, modelkaart op Hugging Face
Staafdiagram van Nvidia met de nauwkeurigheid van Nemotron 3.5 Lightning tegenover Nemotron 3 Nano, Qwen 3.6 35B en Gemma 4 26B op zes benchmarks. Bron: Nvidia, modelkaart op Hugging Face

Het agentraamwerk weegt zwaarder dan de ranglijst

Een tweede grafiek uit dezelfde release is praktischer voor wie dit echt gaat draaien. Dezelfde 500 taken van SWE-bench Verified leveren met de OpenCode-harnas 60,0 procent op, met OpenHands 48,7 procent, met Hermes 45,7 procent en met Codex 11,0 procent, telkens bij ongewijzigde systeemprompts en standaardinstellingen. Het model is getraind op specifieke harnassen, waaronder OpenClaw en Hermes. Welk agentraamwerk je eromheen zet bepaalt dus een groter deel van je resultaat dan het verschil tussen twee modellen op een ranglijst.

Staafdiagram van Nvidia met de score van Nemotron 3.5 Lightning op SWE-Bench Verified en Terminal-Bench 2.1 per agent-harnas, van 60,0 procent met OpenCode tot 11,0 procent met Codex. Bron: Nvidia, modelkaart op Hugging Face
Staafdiagram van Nvidia met de score van Nemotron 3.5 Lightning op SWE-Bench Verified en Terminal-Bench 2.1 per agent-harnas, van 60,0 procent met OpenCode tot 11,0 procent met Codex. Bron: Nvidia, modelkaart op Hugging Face

Wat het draaien vraagt

Een enkele GPU volstaat, maar welke verschilt per variant. De NVFP4-versie die Nvidia aanraadt voor productie noemt een DGX Spark of een H100 als opstelling met een kaart en zet de GeForce RTX 5090 bij de ondersteunde hardware. De volledige BF16-gewichten, bedoeld als startpunt voor eigen natraining, vragen een H100 of A100 met 80 GB. Het contextvenster loopt tot 1 miljoen tokens, al gebruikt Nvidia in zijn BF16-voorbeeld op een H100 256.000. Het model staat op Hugging Face, ModelScope en OpenRouter en op Nvidia's eigen buildplatform; CrowdStrike, Harvey en CodeRabbit testten het vooraf.

De router is het tweede deel van de aankondiging

NeMo Switchyard bepaalt per stap welk model een verzoek afhandelt, op basis van wat een model aankan, wat het kost en wat het systeem op dat moment doet. Er zitten meerdere strategieen in, waaronder een escalatierouter die pas naar een zwaarder model overstapt als hij aanhoudende moeite ziet, en een stagerouter die meebeweegt met de fase waarin een codeeragent zit. Testers melden via Nvidia uiteenlopende uitkomsten: Ramp 58 procent lagere kosten en 33 procent kortere looptijd, Cognition 28 procent lagere gemiddelde kosten, Classmethod 27 procent lagere kosten en Boomi 21 procent minder vertraging in latere beurten.

Kari Briski, vicepresident generatieve AI-software voor bedrijven bij Nvidia, zei tegen het WSJ Leadership Institute dat een router voortdurend kwaliteit, latency en kosten tegen elkaar afweegt en dat routinetaken niet altijd naar het grote model hoeven. Ze noemde een tweede reden om zelf te draaien: bedrijven in gespecialiseerde domeinen als cyberbeveiliging en materiaalkunde moeten volgens haar goed nadenken naar wie ze hun intellectueel eigendom sturen, omdat die partij hun markt kan overnemen. Nvidia bouwde Switchyard naar eigen zeggen eerst voor intern gebruik, om de eigen tokenkosten in bedwang te houden.

Natrainen hoeft ook geen groot project te zijn. CodeRabbit trainde volgens Nvidia voor 85 dollar en in ongeveer twee uur een eigen routeeragent met het standaardrecept, in een enkele trainingsronde.

Waar de verschuiving naartoe wijst

Twee open agentmodellen van 30 miljard parameters in twee dagen, allebei gericht op agents die zelf gereedschap aanroepen, is geen toeval. Dezelfde beweging liep vorige maand al via Nemotron 3 Ultra, dat in LangChains agent-benchmark 4,48 dollar per evaluatie kostte tegen 43,48 dollar voor het dichtstbijzijnde gesloten model. Wat er nu bij komt is dat de chipleverancier ook het gereedschap meelevert om zo min mogelijk naar dat dure model te sturen, onder een licentie die niet vraagt wat je ermee doet.

Daarmee wordt de prijs van AI-werk minder een tarief en meer een ontwerpkeuze. Niet welk model het beste is, maar welke stappen een model van 3 miljard actieve parameters op je eigen kaart mag afhandelen, en welke echt naar de frontier horen.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Routeren in plaats van betalen

Een open model op eigen hardware zetten en het routinewerk daarheen sturen is meer ontwerp dan installatie. Ik denk mee over welke stappen echt naar een duur model moeten, ontwerp de keten eromheen en bouw en automatiseer hem, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Meta geeft agentmodel Muse Glimmer vrij onder Apache 2.0
Nieuws
6 min

10 aug 14:09

Meta geeft agentmodel Muse Glimmer vrij onder Apache 2.0

Meta zet de gewichten van agentmodel Muse Glimmer onder Apache 2.0 op Hugging Face. Het model van 30 miljard parameters draait op één consumenten-GPU en keert de gesloten koers van juni om.

Ornith zet modelfamilie 1.5 open, van 9B tot 397B
Nieuws
6 min

20 aug 06:10

Ornith zet modelfamilie 1.5 open, van 9B tot 397B

Ornith zette de gewichten van modelfamilie 1.5 op Hugging Face, van 9 tot 397 miljard parameters onder een MIT-label. Het LICENSE-bestand waarnaar de modelkaarten verwijzen ontbreekt in alle drie de repositories.

Alibaba publiceert Qwen3.8-27B onder Apache 2.0, zonder omzetdrempel
Nieuws
5 min

14 aug 20:11

Alibaba publiceert Qwen3.8-27B onder Apache 2.0, zonder omzetdrempel

Alibaba zet de gewichten van Qwen3.8-27B onder Apache 2.0 op Hugging Face. Het formaat dat op één videokaart past valt daarmee buiten de licentie met de omzetdrempel van 50 miljoen dollar die het vlaggenschip wel draagt.

Tencent stelt Hy3 wereldwijd beschikbaar via WorkBuddy en Tencent Cloud
Nieuws
5 min

5 aug 10:37

Tencent stelt Hy3 wereldwijd beschikbaar via WorkBuddy en Tencent Cloud

Tencent maakt Hy3 wereldwijd afneembaar via WorkBuddy, Miora en TokenHub. De licentie sluit geen enkel gebied uit, maar het privacybeleid van WorkBuddy zet je gegevens op servers in Singapore, met toegang vanuit China.

Qwen passeert 3 miljard downloads en verdringt Llama en Gemma
Nieuws
5 min

15 aug 12:35

Qwen passeert 3 miljard downloads en verdringt Llama en Gemma

Alibaba's open Qwen-modellen zijn in zes maanden 3 miljard keer gedownload en gaan Meta en Google voorbij. Het cijfer komt van Alibaba zelf, terwijl Hugging Face op de eigen Hub ruim 2 miljard telt.

CodeRabbit breidt AI-codereview uit naar triage en beveiliging na ronde van 143 miljoen dollar
Nieuws
5

12 aug 22:47

CodeRabbit breidt AI-codereview uit naar triage en beveiliging na ronde van 143 miljoen dollar

CodeRabbit haalt 143 miljoen dollar op bij een waardering van 1,5 miljard en breidt zijn AI-codereview uit naar triage, uitleg en beveiliging. Wat die laag kost, en waar ze zelf blind blijft.