AgentCore Evaluations beoordeelt live interacties asynchroon en AWS DevOps Agent zoekt infrastructuuroorzaken uit, meldt AWS op 11 september, zodat productie-agents naast kwaliteit ook hun technische gezondheid bewaken.
Voor een Nederlandse organisatie met een agent in klantservice, planning of een interne operatie verandert de controlelaag. CloudWatch kan laten zien dat modelaanroepen en tools technisch slagen, terwijl de agent het gebruikersdoel mist of stilvalt door een IAM-fout. Deze aanpak maakt kwaliteit en oorzaakonderzoek onderdeel van productiebeheer, niet alleen van de testfase.
Kwaliteit en infrastructuur zijn verschillende vragen
AgentCore Evaluations kijkt naar een andere vraag dan infrastructuurmonitoring. Volgens AWS zijn er 16 ingebouwde evaluatoren, waarvan 13 met een taalmodel werken en 3 deterministisch controleren of een verwachte toolroute is gevolgd. Ze beoordelen sessies, traces en tools op onder meer behulpzaamheid, juistheid, doelrealisatie en toolkeuze.
Dat onderscheid is belangrijk bij systemen met een supervisor-agent en meerdere gespecialiseerde agents. Een tool kan zonder foutmelding terugkeren, terwijl de verkeerde specialist wordt aangeroepen of een reservering niet wordt afgerond. De technische grafieken blijven dan groen, maar de bedrijfsuitkomst is slecht.
Live interacties krijgen een tweede meetlat
Bij online evaluatie laat een organisatie een instelbaar deel van het live verkeer beoordelen. Online evaluatie werkt met steekproeven en filters voor productie-interacties, terwijl AWS in het nieuwe voorbeeld een bereik van 0,01 tot 100 procent noemt. De beoordeling loopt asynchroon naast het verkeer en zit daardoor niet in het antwoordpad voor de gebruiker.
De scores komen via OpenTelemetry in CloudWatch terecht, naast operationele signalen zoals sessies, latency, tokengebruik en fouten. AgentCore Observability slaat die telemetrie op in CloudWatch en toont de uitvoeringsstappen, zodat een team een kwaliteitsdaling kan koppelen aan de trace die eraan voorafging. CloudWatch-alarms kunnen vervolgens reageren op een dalende kwaliteitsmaatstaf, ook als er geen klassieke serverfout is.
AWS gebruikt in de demonstratie Helpfulness, Correctness en Goal Success Rate als drie hoofdmetingen. Dat maakt zichtbaar of een antwoord nuttig en feitelijk juist is en of de taak werkelijk lukt. De beperking blijft dat een deel van deze beoordeling met een LLM-as-a-judge gebeurt. AWS waarschuwt daarom dat scores signalen zijn, geen grondwaarheid, en dat domeinexperts de beoordelaars moeten kalibreren.
DevOps Agent volgt de fout tot aan de oorzaak
De tweede laag begint bij een incident. AWS DevOps Agent koppelt telemetrie, code, deploymentdata en resource-relaties en bouwt daar een actuele topologie van de applicatie mee. In de AWS-demonstratie komt een incident via een ondertekende webhook binnen. De agent zoekt relevante CloudWatch-logs, controleert IAM-permissies en volgt de aanroepketen door de AgentCore-runtime.

In het voorbeeld geeft een luchtvaartagent lege antwoorden. De oorzaak is een ontbrekende Bedrock-modelpermissie op de uitvoeringsrol. De foutketen loopt van gebruikersvraag naar AgentCore-runtime, Bedrock-aanroep en toegangsweigering, zonder dat de gebruiker een bruikbare foutmelding krijgt. AWS schat de handmatige variant van dit onderzoek in de demo op 30 tot 60 minuten, met logboeken, recente releases, IAM-beleid en meerdere agentinteracties die afzonderlijk moeten worden nagekeken.
Hier zit het verschil met gewone uptimebewaking. DevOps Agent probeert niet vast te stellen of een dienst alleen reageert, maar welke afhankelijkheid de agentactie heeft gebroken. Dat kan een permissie zijn, een throttlingprobleem, een mislukte toolaanroep of een overdracht tussen agents. De uitkomst is een getraceerde oorzaak met herstelstappen, niet alleen een alarm.
Van uptime naar aantoonbaar gedrag
De eerdere AWS-aankondiging waarin AgentCore algemeen beschikbaar werd en Guardrails menselijke controle rond agentacties plaatste ging over de vraag wie een agent mag laten handelen. Deze nieuwe stap gaat over wat er na die livegang zichtbaar moet blijven: kwaliteitsscores én een herleidbare technische oorzaak.
Een productie-agent is daarmee pas bestuurbaar wanneer twee vragen tegelijk beantwoord kunnen worden: deed hij technisch wat hij moest doen, en hielp hij de gebruiker zijn doel te bereiken? AWS zet die twee vragen nu naast elkaar in één operationele lus.
Veelgestelde vragen
Productie vraagt om zicht
Ik help je AI-agents van ontwerp tot livegang betrouwbaar inrichten: ik denk mee over de taak, ontwerp de controlelaag, bouw de koppelingen en automatiseer het beheer. Waar het kan self-hosted, zodat je zicht houdt op data, kosten en gedrag.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
