Een scherm met code achter een bril op een bureau
Nieuws10 september · 10:573 min leestijd

Red Hat maakt AI 3.5 klaar voor beheerde productie

Red Hat AI 3.5 maakt EvalHub, multi-tenancy, agentbeveiliging en observability algemeen beschikbaar. Voor Nederlandse organisaties verschuift de beheeropgave daarmee van een model kiezen naar vooraf testen, bevoegdheden afbakenen en verbruik aantonen.

Red Hat AI 3.5 is sinds 9 september algemeen beschikbaar met EvalHub, observabilitydashboards en multi-tenancy, meldt Red Hat, voor organisaties die AI buiten de pilotfase willen beheren.

Voor een Nederlandse organisatie verandert daarmee de beheerlaag rond AI. Je kunt modellen vóór uitrol op veiligheidsrisico’s testen, gedeelde GPU-capaciteit verdelen en tokenverbruik per gebruiker zichtbaar maken. De inzet verschuift van een model kiezen naar aantonen wie wat mag gebruiken, tegen welke kosten en met welk toezicht.

EvalHub maakt de test herhaalbaar

Red Hat maakt EvalHub in AI 3.5 algemeen beschikbaar voor modellen, RAG-configuraties en agents. Teams kunnen veiligheidstests draaien op risico’s zoals prompt injection en jailbreaks en de resultaten gebruiken voor auditeerbare rapportage. De officiële documentatie beschrijft dat evaluaties als geïsoleerde taken draaien en per tenant worden afgeschermd via Kubernetes-namespaces en tenant_id.

De catalogus krijgt meer dan twintig nieuwe gevalideerde modellen met Garak-scores voor veiligheid, blootstelling van persoonsgegevens en toxiciteit, waaronder Gemma 4 van Google, Nemotron 3 van Nvidia en Qwen van Alibaba Cloud, zo meldt Techzine. Daarmee wordt modelkeuze niet alleen een vergelijking van kwaliteit en snelheid, maar ook van vooraf vastgelegde veiligheidsdrempels.

Gedeelde GPU’s krijgen verkeersregels

Multi-tenancy gaat hier verder dan meerdere projecten op één cluster. Fair-share scheduling verdeelt capaciteit over tenants, terwijl priority-aware serving realtime-inferentie voorrang kan geven en achtergrondtaken laat wachten. Voor strengere scheiding ondersteunt Red Hat hosted control planes op OpenShift Virtualization: iedere tenant krijgt een eigen clustercontrol plane, terwijl de hardware gedeeld blijft.

Dat maakt kostenbeheersing concreter, maar het maakt eigenaarschap ook zichtbaar. Een platformteam moet vooraf vastleggen welke workloads realtime zijn, welke mogen wachten en welke tenant welke capaciteit mag gebruiken. Dat sluit aan bij de vijf afspraken voor productieagenten: mandaat, escalatie, logging, kill-switch en eigenaarschap.

Observability wordt onderdeel van beheer

De nieuwe dashboards tonen inference health, GPU-benutting en modelprestaties. Niet alleen beheerders krijgen inzicht: projectgebruikers kunnen serving metrics bekijken en per gebruiker tokenverbruik volgen. MLflow levert visuele tracing van meerstapsagenten, terwijl die tracing nog als technology preview geldt. Zo wordt zichtbaar waar in een agentketen een modelstap, toolcall of wachtrij de tijd en middelen verbruikt.

Agentcontroles hebben niet allemaal dezelfde status

De Responses API en ingebouwde RAG zijn algemeen beschikbaar, net als agent templates voor code review, documentverwerking en onderzoek. NeMo Guardrails bewaakt gesprekken en kan toolcalls binnen beleidsregels houden. De gatewaylaag die elke oproep naar een externe tool of API monitort en een kwaadaardige actie vóór het backend kan blokkeren, staat nog als technology preview, schrijft Red Hat.

Welke vragen horen bij productie?

Voor teams die deze functies beoordelen, komen vier beheer- en auditvragen boven tafel. Beheersing betekent hier dat een antwoord terug te vinden is in configuratie, logboek of dashboard, niet alleen in een leverancierstoezegging.

  • Veiligheid: welke prompt-injection- en jailbreaktests moet een model, RAG-configuratie of agent halen vóór uitrol?
  • Toegang: welke tenant, gebruiker of rol mag een agent welke tool of gegevensbron laten aanroepen?
  • Kosten: kun je tokenverbruik per gebruiker en GPU-gebruik terugzien, ook zonder clusterbeheerder te zijn?
  • Ingrijpen: welke acties blokkeert de runtime zelf en welke controle is nog technology preview?

Van pilot naar beheerde infrastructuur

De release markeert geen nieuwe modeldoorbraak. De verschuiving zit in de laag eromheen: AI wordt behandeld als gedeelde infrastructuur met bewijs vóór uitrol, regels voor bevoegdheden en zicht op verbruik tijdens gebruik. Voor een organisatie die een agent uit een proefomgeving haalt, wordt een demo daarmee niet het eindpunt maar het begin van aantoonbaar beheer.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

AI met duidelijke grenzen

Ik denk mee over veilige AI-agents, ontwerp de beheerlaag en bouw het hele traject van eerste idee tot live automatisering. Waar het kan houd ik de data en infrastructuur self-hosted.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

Broadcom lanceert VMware Private AI Cloud met meer dan 150 modellen op eigen infrastructuur
Nieuws
6 min

31 aug 16:47

Broadcom lanceert VMware Private AI Cloud met meer dan 150 modellen op eigen infrastructuur

Broadcom bundelt AI-inferentie, agents en klassieke workloads op VMware Cloud Foundation en valideert vijf modellen voor eigen datacenters. AgentMinder is er nu, de AI Gateway en de agentbeveiliging volgen later.

Qwen passeert 3 miljard downloads en verdringt Llama en Gemma
Nieuws
5 min

15 aug 12:35

Qwen passeert 3 miljard downloads en verdringt Llama en Gemma

Alibaba's open Qwen-modellen zijn in zes maanden 3 miljard keer gedownload en gaan Meta en Google voorbij. Het cijfer komt van Alibaba zelf, terwijl Hugging Face op de eigen Hub ruim 2 miljard telt.

Amerikaanse subcommissie stuurt wet door die Chinese open modellen laat doorlichten
Nieuws
4 min

2 sep 06:35

Amerikaanse subcommissie stuurt wet door die Chinese open modellen laat doorlichten

De Open-Source AI Leadership Act passeerde dinsdag de subcommissie Commerce, Manufacturing and Trade. De wet verplicht het Amerikaanse ministerie van Handel tot een openbaar jaarrapport over de risico's van Chinese open modellen.

Alibaba zet Qwen3.8-Flash-Next open en rekent 0,16 dollar per miljoen tokens
Nieuws
5 min

27 aug 02:22

Alibaba zet Qwen3.8-Flash-Next open en rekent 0,16 dollar per miljoen tokens

Alibaba zet de gewichten van Qwen3.8-Flash-Next open. Het model activeert 6 van 176 miljard parameters per token, kost gehost 0,16 dollar per miljoen invoertokens en komt met een strakkere licentie dan het vlaggenschip.

Alibaba verkoopt voor 10,2 miljard dollar aandelen om zijn AI-stack te betalen
Nieuws
3

23 aug 12:10

Alibaba verkoopt voor 10,2 miljard dollar aandelen om zijn AI-stack te betalen

Alibaba verkoopt 710 miljoen nieuwe aandelen in Hongkong voor 10,2 miljard dollar en investeert de volledige opbrengst in chips, AI-infrastructuur en de ontwikkeling van modellen. Wat dat betekent voor teams die op Qwen en Alibaba Cloud draaien.

Google’s Gemma-modellen passeren een miljard downloads
Nieuws
5 min

21 aug 06:20

Google’s Gemma-modellen passeren een miljard downloads

Google telt een miljard downloads voor zijn open Gemma-modellen en ruim honderdduizend afgeleide varianten. Belangrijker dan het cijfer is de licentie: Gemma 4 staat onder een kale Apache 2.0-tekst.