Kleurrijke broncode op een computerscherm
Nieuws9 september · 06:454 min leestijd

Zepto maakt AI-klantagenten productiegeschikt met evaluaties

Zepto laat zien hoe evaluaties, traces en kwaliteitspoorten AI-klantagenten naar productie brengen. Databricks meldt 65 procent lagere supportkosten, terwijl Zepto ruim 80 procent van de tickets met AI afhandelt.

Zepto maakt evaluaties tot verplichte kwaliteitspoort voor zijn AI-klantagenten, meldt Databricks, waarmee de Indiase bezorgdienst ruim 80 procent van zijn supporttickets met menselijke controle afhandelt.

Voor Nederlandse organisaties verandert daarmee de volgorde van bouwen: een agent gaat niet eerst live om daarna op klachten te worden bijgesteld. De meetlat, logboeken en terugval naar een mens horen vóór de productie-uitrol in hetzelfde ontwerp, zodat kwaliteit, kosten en risico per release zichtbaar blijven.

Een release krijgt een bewijsdrempel

Zepto draait klantservice met meerdere gespecialiseerde agents voor onder meer orderstatus, ontbrekende producten, retouren en kwaliteitsproblemen. Het systeem verwerkt volgens de case study meer dan 100.000 tickets per dag. Zepto bevestigt zelf dat het zijn AI-agents voor klantservice bouwt, uitrolt en continu evalueert.

De beschreven aanpak heeft twee lussen. In de ontwikkellus worden nieuwe prompts, modellen en agentlogica getoetst aan een gouden dataset. Een kwaliteitspoort vergelijkt de uitkomst met de bestaande productieversie. Alleen een versie die de afgesproken drempels voor kwaliteit, kosten en snelheid haalt, gaat door. In de productielus worden echte interacties getraceerd en beoordeeld. Fouten gaan terug naar de dataset voor de volgende ontwikkelronde.

Databricks-diagram van de ontwikkel- en productielus met evaluatiepoort, bron: Databricks
Databricks-diagram van de ontwikkel- en productielus met evaluatiepoort, bron: Databricks

Wat er onder de motorkap gebeurt

De traces leggen het hele verloop vast: prompts, opgehaalde documenten, toolaanroepen, latentie en beslispaden. De gouden dataset groeide in zes maanden van 500 naar 5.247 voorbeelden. In dezelfde periode kromp het verschil tussen de nauwkeurigheid in ontwikkeling en productie van acht naar 0,4 procentpunt.

Een concreet voorbeeld laat zien waarom dat verschil telt. Toen Zepto afhandeling van annuleringen toevoegde aan zijn orderstatus-agent, zakte de intent-nauwkeurigheid van ongeveer 92,1 naar 87,4 procent. De regressietest zag dat voordat klanten ermee te maken kregen. Na aanpassing van prompts en dataset kwam de score uit op ongeveer 94,2 procent, waarna de functie zonder rollback live ging.

De officiële documentatie van Databricks beschrijft MLflow 3 als een laag die tracing, scorers, menselijke feedback en versiebeheer voor AI-apps en agents samenbrengt. Zepto combineert daarbij automatische beoordelaars met regels voor meetbare zaken zoals latentie en het aantal toolaanroepen. Voor beoordelingen die menselijk oordeel vragen, worden de taalmodellen eerst gekalibreerd tegen menselijke labels.

In productie gebruikt Zepto volgens de case geen willekeurige steekproef, maar een indeling die extra kijkt naar risicovolle routes, nieuwe functies, negatieve sentimenten en beeldclaims. Zo wordt naar schatting 18 tot 20 procent van de interacties beoordeeld, ongeveer 14.400 traces per dag. Dat zou 45 tot 60 procent van de randgevallen vangen en problemen in vier tot zes minuten zichtbaar maken.

De cijfers vragen om context

Databricks rapporteert voor Zepto ruim 80 procent AI-afhandeling met menselijke controle, 65 procent lagere supportkosten, 20 procent hogere klanttevredenheid, acht procent hogere nauwkeurigheid en een terugverdientijd onder één maand. Dezelfde case meldt drie keer snellere ontwikkelcycli en vier keer snellere oplossingstijd.

Dat zijn resultaten uit een leverancierscase study. De publicatie beschrijft geen onafhankelijke audit, controlegroep of volledige meetmethode voor de percentages. De eigen communicatie van Zepto bevestigt de werkwijze rond continu evalueren, maar niet zelfstandig al deze uitkomsten. De cijfers zijn daarom vooral bruikbaar als gerapporteerde praktijkervaring, niet als garantie voor een andere organisatie.

Evaluatie wordt onderdeel van de software

De toepasbare verschuiving zit niet in een extra chatbotfunctie, maar in de releaseprocedure. Een agent krijgt een eigen testset met normale, risicovolle en mislukte situaties, een meetbare poort vóór livegang en observability die productieproblemen terugbrengt naar nieuwe tests. Dat sluit aan op logging, tokenbudgetten en een kill-switch voor AI-agents: zichtbaarheid heeft pas waarde als een organisatie ook kan begrenzen en ingrijpen.

Voor klantcontact, documentverwerking of interne automatisering betekent dit dat evaluatie geen rapport achteraf meer is. Het wordt een onderdeel van de software zelf, net als versiebeheer en toegangscontrole. Wie agents op echte processen inzet, krijgt daarmee een nieuwe minimale productiestandaard: elke wijziging moet aantonen dat ze werkt en minstens even betrouwbaar is als wat er al draait.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

AI die zich moet bewijzen

Ik help je AI-agents ontwerpen die meetbaar betrouwbaar blijven, van eerste test tot productie. Ik denk mee, ontwerp, bouw en automatiseer het hele traject, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

Databricks haalt 5 miljard dollar op bij een waardering van 190 miljard
Nieuws
5 min

14 aug 06:11

Databricks haalt 5 miljard dollar op bij een waardering van 190 miljard

Databricks sluit een ronde van 5 miljard dollar bij een waardering van 190 miljard en steekt het geld in Lakebase, Genie en de Unity AI Gateway. Wat dat betekent voor teams die al op het platform draaien.

Dynatrace koopt Arize voor 915 miljoen dollar en trekt AI-monitoring in zijn platform
Nieuws
5 min

14 aug 02:10

Dynatrace koopt Arize voor 915 miljoen dollar en trekt AI-monitoring in zijn platform

Dynatrace betaalt 915 miljoen dollar voor Arize en trekt het bewaken van AI-modellen in productie zijn eigen observability-platform in. Voor wie AI live heeft staan verandert dat vooral de inkoopvraag: consolideren of een eigen monitoringlaag houden.

Enigmata brengt Cipher uit voor AI op versleutelde data
Nieuws
4 min

11 sep 20:42

Enigmata brengt Cipher uit voor AI op versleutelde data

Enigmata presenteert Cipher voor AI op versleutelde data. Het bedrijf claimt 1 tot 3 GB/s doorvoer en 8 tot 10 procent snellere training, maar de uitrol blijft beperkt tot geselecteerde designpartners.

OpenAI brengt Data Agent naar ChatGPT Work voor bedrijfsdata
Nieuws
4 min

11 sep 18:20

OpenAI brengt Data Agent naar ChatGPT Work voor bedrijfsdata

OpenAI brengt Data Agent naar ChatGPT Work. De plugin analyseert bedrijfsdata, maakt interactieve dashboards en voert goedgekeurde acties uit. Connectoren, bedrijfsdefinities en toegangsrechten bepalen hoe bruikbaar de uitkomst wordt voor Nederlandse teams.

Red Hat maakt AI 3.5 klaar voor beheerde productie
Nieuws
3 min

10 sep 10:57

Red Hat maakt AI 3.5 klaar voor beheerde productie

Red Hat AI 3.5 maakt EvalHub, multi-tenancy, agentbeveiliging en observability algemeen beschikbaar. Voor Nederlandse organisaties verschuift de beheeropgave daarmee van een model kiezen naar vooraf testen, bevoegdheden afbakenen en verbruik aantonen.

Zeroday in Magento en Adobe Commerce wordt actief misbruikt, patch ontbreekt
Nieuws
6 min

7 sep 16:11

Zeroday in Magento en Adobe Commerce wordt actief misbruikt, patch ontbreekt

Beveiligingsbedrijf Sansec meldt actief misbruik van StyleSmuggler, een ongepatchte kwetsbaarheid waarmee aanvallers zonder inloggen code uitvoeren op Magento en Adobe Commerce. Ook volledig bijgewerkte webshops zijn geraakt en Adobe heeft nog geen patch.