Close-up van een Nvidia GeForce RTX-videokaart
Nieuws11 augustus · 16:105 min leestijd

Nvidia geeft agentmodel Nemotron 3.5 Lightning vrij met een modelrouter erbij

Nvidia publiceert de gewichten van agentmodel Nemotron 3.5 Lightning onder OpenMDW-1.1, een licentie zonder gebruiksbeperkingen, en levert er een routeerlaag bij die in LangChains test 74 procent van de kosten wegneemt.

Nvidia brengt Nemotron 3.5 Lightning uit, een open agentmodel van 30 miljard parameters waarvan er 3 miljard per token actief zijn, en publiceert de gewichten, de trainingsdata en de trainingsrecepten op Hugging Face.

Het model is niet bedoeld om je slimste model te vervangen, maar om het uitvoerende werk eronder over te nemen: tools aanroepen, uitkomsten controleren, subagents aansturen. Daar loopt de tokenrekening op. Nvidia levert er daarom meteen een routeerlaag bij, NeMo Switchyard, en in LangChains test daarmee ging 7 procent van de aanroepen naar Claude Opus 4.8 en de rest naar Lightning, met 74 procent lagere kosten dan wanneer alles naar het topmodel gaat. Voor een Nederlands bedrijf dat vandaag per token afrekent bij een API verschuift de vraag daarmee van welk model het slimst is naar welke stappen niet naar het dure model hoeven.

De licentie legt geen enkele gebruiksbeperking op

Het LICENSE-bestand in de repository is de onveranderde tekst van OpenMDW-1.1. Die geeft toestemming om zonder beperking met het model te handelen, onder auteursrecht, octrooirecht, databankrecht en bedrijfsgeheim. Er staat geen uitsluiting van de EU in, geen omzetgrens en geen lijst met verboden toepassingen, en de download zit niet achter een goedkeuringsformulier. Wie de bestanden zelf verder verspreidt hoeft alleen een kopie van de licentie en de herkomstvermeldingen mee te leveren. Over wat het model produceert legt de tekst expliciet niets op.

Een clausule is het lezen waard. Begin je een octrooi- of auteursrechtzaak over het model, dan vervallen al je rechten eronder, tenzij je zelf eerst was aangeklaagd. Verder noemt de modelkaart geen aanvullende voorwaarden: OpenMDW-1.1 is de enige geldende tekst.

Dat is minder beperkend dan bij Meta's agentmodel Muse Glimmer, dat een dag eerder onder onveranderde Apache 2.0 verscheen maar een aparte usage policy meekreeg die militair gebruik en het bedienen van kritieke infrastructuur verbiedt. Dat het addertje in de licentietekst zit en niet in de modelkaart bleek eind juli nog bij MiniMax, dat de gewichten van videomodel H3 online zette maar de EU als Excluded Territory uitsloot.

Snel, niet het slimst

Op de benchmarks die Nvidia zelf publiceert verliest Lightning van Qwen 3.6 35B A3B, een open model in dezelfde gewichtsklasse. Op SWE-bench Verified scoort het 51,56 tegen 70,12, op Terminal-Bench 2.1 24,58 tegen 44,38 en op MMLU Pro 81,94 tegen 85,63. Instructies opvolgen gaat wel beter: op IFBench 71,88 tegen 63,71.

De winst moet uit snelheid komen. Nvidia claimt tot vier keer meer uitvoersnelheid dan modellen van vergelijkbare grootte, en op PinchBench 86 procent nauwkeurigheid terwijl het 10.000 taken 30 procent sneller afrondt dan Qwen 3.6 35B. Alle cijfers komen uit Nvidia's eigen testopstelling, niet van een onafhankelijke partij.

Staafdiagram van Nvidia met de nauwkeurigheid van Nemotron 3.5 Lightning tegenover Nemotron 3 Nano, Qwen 3.6 35B en Gemma 4 26B op zes benchmarks. Bron: Nvidia, modelkaart op Hugging Face
Staafdiagram van Nvidia met de nauwkeurigheid van Nemotron 3.5 Lightning tegenover Nemotron 3 Nano, Qwen 3.6 35B en Gemma 4 26B op zes benchmarks. Bron: Nvidia, modelkaart op Hugging Face

Het agentraamwerk weegt zwaarder dan de ranglijst

Een tweede grafiek uit dezelfde release is praktischer voor wie dit echt gaat draaien. Dezelfde 500 taken van SWE-bench Verified leveren met de OpenCode-harnas 60,0 procent op, met OpenHands 48,7 procent, met Hermes 45,7 procent en met Codex 11,0 procent, telkens bij ongewijzigde systeemprompts en standaardinstellingen. Het model is getraind op specifieke harnassen, waaronder OpenClaw en Hermes. Welk agentraamwerk je eromheen zet bepaalt dus een groter deel van je resultaat dan het verschil tussen twee modellen op een ranglijst.

Staafdiagram van Nvidia met de score van Nemotron 3.5 Lightning op SWE-Bench Verified en Terminal-Bench 2.1 per agent-harnas, van 60,0 procent met OpenCode tot 11,0 procent met Codex. Bron: Nvidia, modelkaart op Hugging Face
Staafdiagram van Nvidia met de score van Nemotron 3.5 Lightning op SWE-Bench Verified en Terminal-Bench 2.1 per agent-harnas, van 60,0 procent met OpenCode tot 11,0 procent met Codex. Bron: Nvidia, modelkaart op Hugging Face

Wat het draaien vraagt

Een enkele GPU volstaat, maar welke verschilt per variant. De NVFP4-versie die Nvidia aanraadt voor productie noemt een DGX Spark of een H100 als opstelling met een kaart en zet de GeForce RTX 5090 bij de ondersteunde hardware. De volledige BF16-gewichten, bedoeld als startpunt voor eigen natraining, vragen een H100 of A100 met 80 GB. Het contextvenster loopt tot 1 miljoen tokens, al gebruikt Nvidia in zijn BF16-voorbeeld op een H100 256.000. Het model staat op Hugging Face, ModelScope en OpenRouter en op Nvidia's eigen buildplatform; CrowdStrike, Harvey en CodeRabbit testten het vooraf.

De router is het tweede deel van de aankondiging

NeMo Switchyard bepaalt per stap welk model een verzoek afhandelt, op basis van wat een model aankan, wat het kost en wat het systeem op dat moment doet. Er zitten meerdere strategieen in, waaronder een escalatierouter die pas naar een zwaarder model overstapt als hij aanhoudende moeite ziet, en een stagerouter die meebeweegt met de fase waarin een codeeragent zit. Testers melden via Nvidia uiteenlopende uitkomsten: Ramp 58 procent lagere kosten en 33 procent kortere looptijd, Cognition 28 procent lagere gemiddelde kosten, Classmethod 27 procent lagere kosten en Boomi 21 procent minder vertraging in latere beurten.

Kari Briski, vicepresident generatieve AI-software voor bedrijven bij Nvidia, zei tegen het WSJ Leadership Institute dat een router voortdurend kwaliteit, latency en kosten tegen elkaar afweegt en dat routinetaken niet altijd naar het grote model hoeven. Ze noemde een tweede reden om zelf te draaien: bedrijven in gespecialiseerde domeinen als cyberbeveiliging en materiaalkunde moeten volgens haar goed nadenken naar wie ze hun intellectueel eigendom sturen, omdat die partij hun markt kan overnemen. Nvidia bouwde Switchyard naar eigen zeggen eerst voor intern gebruik, om de eigen tokenkosten in bedwang te houden.

Natrainen hoeft ook geen groot project te zijn. CodeRabbit trainde volgens Nvidia voor 85 dollar en in ongeveer twee uur een eigen routeeragent met het standaardrecept, in een enkele trainingsronde.

Waar de verschuiving naartoe wijst

Twee open agentmodellen van 30 miljard parameters in twee dagen, allebei gericht op agents die zelf gereedschap aanroepen, is geen toeval. Dezelfde beweging liep vorige maand al via Nemotron 3 Ultra, dat in LangChains agent-benchmark 4,48 dollar per evaluatie kostte tegen 43,48 dollar voor het dichtstbijzijnde gesloten model. Wat er nu bij komt is dat de chipleverancier ook het gereedschap meelevert om zo min mogelijk naar dat dure model te sturen, onder een licentie die niet vraagt wat je ermee doet.

Daarmee wordt de prijs van AI-werk minder een tarief en meer een ontwerpkeuze. Niet welk model het beste is, maar welke stappen een model van 3 miljard actieve parameters op je eigen kaart mag afhandelen, en welke echt naar de frontier horen.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Routeren in plaats van betalen

Een open model op eigen hardware zetten en het routinewerk daarheen sturen is meer ontwerp dan installatie. Ik denk mee over welke stappen echt naar een duur model moeten, ontwerp de keten eromheen en bouw en automatiseer hem, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Meta geeft agentmodel Muse Glimmer vrij onder Apache 2.0
Nieuws
6 minBijgewerkt om 18:29

10 aug 14:09

Meta geeft agentmodel Muse Glimmer vrij onder Apache 2.0

Meta zet de gewichten van agentmodel Muse Glimmer onder Apache 2.0 op Hugging Face. Het model van 30 miljard parameters draait op één consumenten-GPU en keert de gesloten koers van juni om.

Tencent stelt Hy3 wereldwijd beschikbaar via WorkBuddy en Tencent Cloud
Nieuws
5 min

5 aug 10:37

Tencent stelt Hy3 wereldwijd beschikbaar via WorkBuddy en Tencent Cloud

Tencent maakt Hy3 wereldwijd afneembaar via WorkBuddy, Miora en TokenHub. De licentie sluit geen enkel gebied uit, maar het privacybeleid van WorkBuddy zet je gegevens op servers in Singapore, met toegang vanuit China.

Alibaba wil omzetdeling vragen voor de volgende open-source Qwen
Nieuws
4 min

7 aug 04:10

Alibaba wil omzetdeling vragen voor de volgende open-source Qwen

Alibaba wil grote gebruikers van de volgende open-source Qwen een deel van hun omzet laten afdragen, meldt Reuters. Het sjabloon staat al in de licentie van Kimi K3: boven 20 miljoen dollar omzet volgt een aparte overeenkomst.

Amerikaanse AI splitst in twee lagen, en de NSA trekt de grens
Signaal
7 min

2 aug 00:02

Amerikaanse AI splitst in twee lagen, en de NSA trekt de grens

Westerse labs publiceren meer modelgewichten dan ooit, terwijl hun topmodellen eerst naar Washington gaan. Sinds Executive Order 14409 loopt er een geheime NSA-drempel tussen die twee lagen.

GLM-5.2 weigert in test van SaferAI geen enkele offensieve cyber- of biotaak
Nieuws
5 min

5 aug 04:11

GLM-5.2 weigert in test van SaferAI geen enkele offensieve cyber- of biotaak

Het Franse SaferAI mat GLM-5.2 langs de vier systeemrisico's van de EU-Gedragscode. Het Chinese open model weigerde geen enkele offensieve cyber- of biologietaak, terwijl Claude Opus 4.7 zo vaak weigerde dat een benchmark niet af kwam.

Alibaba zet de gewichten van Qwen3.8-Max volgende week open
Nieuws
5 min

3 aug 06:12

Alibaba zet de gewichten van Qwen3.8-Max volgende week open

Alibaba maakt Qwen3.8-Max wereldwijd beschikbaar en zet de gewichten volgende week open, samen met een kleinere 27B-versie. Het gehoste model kost 2 dollar per miljoen invoertokens, ruim onder Claude Opus 5.