Zepto maakt evaluaties tot verplichte kwaliteitspoort voor zijn AI-klantagenten, meldt Databricks, waarmee de Indiase bezorgdienst ruim 80 procent van zijn supporttickets met menselijke controle afhandelt.
Voor Nederlandse organisaties verandert daarmee de volgorde van bouwen: een agent gaat niet eerst live om daarna op klachten te worden bijgesteld. De meetlat, logboeken en terugval naar een mens horen vóór de productie-uitrol in hetzelfde ontwerp, zodat kwaliteit, kosten en risico per release zichtbaar blijven.
Een release krijgt een bewijsdrempel
Zepto draait klantservice met meerdere gespecialiseerde agents voor onder meer orderstatus, ontbrekende producten, retouren en kwaliteitsproblemen. Het systeem verwerkt volgens de case study meer dan 100.000 tickets per dag. Zepto bevestigt zelf dat het zijn AI-agents voor klantservice bouwt, uitrolt en continu evalueert.
De beschreven aanpak heeft twee lussen. In de ontwikkellus worden nieuwe prompts, modellen en agentlogica getoetst aan een gouden dataset. Een kwaliteitspoort vergelijkt de uitkomst met de bestaande productieversie. Alleen een versie die de afgesproken drempels voor kwaliteit, kosten en snelheid haalt, gaat door. In de productielus worden echte interacties getraceerd en beoordeeld. Fouten gaan terug naar de dataset voor de volgende ontwikkelronde.

Wat er onder de motorkap gebeurt
De traces leggen het hele verloop vast: prompts, opgehaalde documenten, toolaanroepen, latentie en beslispaden. De gouden dataset groeide in zes maanden van 500 naar 5.247 voorbeelden. In dezelfde periode kromp het verschil tussen de nauwkeurigheid in ontwikkeling en productie van acht naar 0,4 procentpunt.
Een concreet voorbeeld laat zien waarom dat verschil telt. Toen Zepto afhandeling van annuleringen toevoegde aan zijn orderstatus-agent, zakte de intent-nauwkeurigheid van ongeveer 92,1 naar 87,4 procent. De regressietest zag dat voordat klanten ermee te maken kregen. Na aanpassing van prompts en dataset kwam de score uit op ongeveer 94,2 procent, waarna de functie zonder rollback live ging.
De officiële documentatie van Databricks beschrijft MLflow 3 als een laag die tracing, scorers, menselijke feedback en versiebeheer voor AI-apps en agents samenbrengt. Zepto combineert daarbij automatische beoordelaars met regels voor meetbare zaken zoals latentie en het aantal toolaanroepen. Voor beoordelingen die menselijk oordeel vragen, worden de taalmodellen eerst gekalibreerd tegen menselijke labels.
In productie gebruikt Zepto volgens de case geen willekeurige steekproef, maar een indeling die extra kijkt naar risicovolle routes, nieuwe functies, negatieve sentimenten en beeldclaims. Zo wordt naar schatting 18 tot 20 procent van de interacties beoordeeld, ongeveer 14.400 traces per dag. Dat zou 45 tot 60 procent van de randgevallen vangen en problemen in vier tot zes minuten zichtbaar maken.
De cijfers vragen om context
Databricks rapporteert voor Zepto ruim 80 procent AI-afhandeling met menselijke controle, 65 procent lagere supportkosten, 20 procent hogere klanttevredenheid, acht procent hogere nauwkeurigheid en een terugverdientijd onder één maand. Dezelfde case meldt drie keer snellere ontwikkelcycli en vier keer snellere oplossingstijd.
Dat zijn resultaten uit een leverancierscase study. De publicatie beschrijft geen onafhankelijke audit, controlegroep of volledige meetmethode voor de percentages. De eigen communicatie van Zepto bevestigt de werkwijze rond continu evalueren, maar niet zelfstandig al deze uitkomsten. De cijfers zijn daarom vooral bruikbaar als gerapporteerde praktijkervaring, niet als garantie voor een andere organisatie.
Evaluatie wordt onderdeel van de software
De toepasbare verschuiving zit niet in een extra chatbotfunctie, maar in de releaseprocedure. Een agent krijgt een eigen testset met normale, risicovolle en mislukte situaties, een meetbare poort vóór livegang en observability die productieproblemen terugbrengt naar nieuwe tests. Dat sluit aan op logging, tokenbudgetten en een kill-switch voor AI-agents: zichtbaarheid heeft pas waarde als een organisatie ook kan begrenzen en ingrijpen.
Voor klantcontact, documentverwerking of interne automatisering betekent dit dat evaluatie geen rapport achteraf meer is. Het wordt een onderdeel van de software zelf, net als versiebeheer en toegangscontrole. Wie agents op echte processen inzet, krijgt daarmee een nieuwe minimale productiestandaard: elke wijziging moet aantonen dat ze werkt en minstens even betrouwbaar is als wat er al draait.
Veelgestelde vragen
AI die zich moet bewijzen
Ik help je AI-agents ontwerpen die meetbaar betrouwbaar blijven, van eerste test tot productie. Ik denk mee, ontwerp, bouw en automatiseer het hele traject, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
