Computerchip op een verlichte printplaat, door Brecht Corbeel via Unsplash
Nieuws11 september · 22:115 min leestijd

AWS bewaakt productie-agents met Evaluations en DevOps Agent

AWS koppelt live kwaliteitsmetingen voor productie-agents aan geautomatiseerd oorzaakonderzoek. AgentCore Evaluations scoort een steekproef van interacties asynchroon, terwijl DevOps Agent IAM-, CloudWatch- en runtime-sporen samenbrengt bij incidenten.

AgentCore Evaluations beoordeelt live interacties asynchroon en AWS DevOps Agent zoekt infrastructuuroorzaken uit, meldt AWS op 11 september, zodat productie-agents naast kwaliteit ook hun technische gezondheid bewaken.

Voor een Nederlandse organisatie met een agent in klantservice, planning of een interne operatie verandert de controlelaag. CloudWatch kan laten zien dat modelaanroepen en tools technisch slagen, terwijl de agent het gebruikersdoel mist of stilvalt door een IAM-fout. Deze aanpak maakt kwaliteit en oorzaakonderzoek onderdeel van productiebeheer, niet alleen van de testfase.

Kwaliteit en infrastructuur zijn verschillende vragen

AgentCore Evaluations kijkt naar een andere vraag dan infrastructuurmonitoring. Volgens AWS zijn er 16 ingebouwde evaluatoren, waarvan 13 met een taalmodel werken en 3 deterministisch controleren of een verwachte toolroute is gevolgd. Ze beoordelen sessies, traces en tools op onder meer behulpzaamheid, juistheid, doelrealisatie en toolkeuze.

Dat onderscheid is belangrijk bij systemen met een supervisor-agent en meerdere gespecialiseerde agents. Een tool kan zonder foutmelding terugkeren, terwijl de verkeerde specialist wordt aangeroepen of een reservering niet wordt afgerond. De technische grafieken blijven dan groen, maar de bedrijfsuitkomst is slecht.

Live interacties krijgen een tweede meetlat

Bij online evaluatie laat een organisatie een instelbaar deel van het live verkeer beoordelen. Online evaluatie werkt met steekproeven en filters voor productie-interacties, terwijl AWS in het nieuwe voorbeeld een bereik van 0,01 tot 100 procent noemt. De beoordeling loopt asynchroon naast het verkeer en zit daardoor niet in het antwoordpad voor de gebruiker.

De scores komen via OpenTelemetry in CloudWatch terecht, naast operationele signalen zoals sessies, latency, tokengebruik en fouten. AgentCore Observability slaat die telemetrie op in CloudWatch en toont de uitvoeringsstappen, zodat een team een kwaliteitsdaling kan koppelen aan de trace die eraan voorafging. CloudWatch-alarms kunnen vervolgens reageren op een dalende kwaliteitsmaatstaf, ook als er geen klassieke serverfout is.

AWS gebruikt in de demonstratie Helpfulness, Correctness en Goal Success Rate als drie hoofdmetingen. Dat maakt zichtbaar of een antwoord nuttig en feitelijk juist is en of de taak werkelijk lukt. De beperking blijft dat een deel van deze beoordeling met een LLM-as-a-judge gebeurt. AWS waarschuwt daarom dat scores signalen zijn, geen grondwaarheid, en dat domeinexperts de beoordelaars moeten kalibreren.

DevOps Agent volgt de fout tot aan de oorzaak

De tweede laag begint bij een incident. AWS DevOps Agent koppelt telemetrie, code, deploymentdata en resource-relaties en bouwt daar een actuele topologie van de applicatie mee. In de AWS-demonstratie komt een incident via een ondertekende webhook binnen. De agent zoekt relevante CloudWatch-logs, controleert IAM-permissies en volgt de aanroepketen door de AgentCore-runtime.

AWS DevOps Agent toont de gevonden IAM-permissiefout in de incidentweergave, bron: AWS
AWS DevOps Agent toont de gevonden IAM-permissiefout in de incidentweergave, bron: AWS

In het voorbeeld geeft een luchtvaartagent lege antwoorden. De oorzaak is een ontbrekende Bedrock-modelpermissie op de uitvoeringsrol. De foutketen loopt van gebruikersvraag naar AgentCore-runtime, Bedrock-aanroep en toegangsweigering, zonder dat de gebruiker een bruikbare foutmelding krijgt. AWS schat de handmatige variant van dit onderzoek in de demo op 30 tot 60 minuten, met logboeken, recente releases, IAM-beleid en meerdere agentinteracties die afzonderlijk moeten worden nagekeken.

Hier zit het verschil met gewone uptimebewaking. DevOps Agent probeert niet vast te stellen of een dienst alleen reageert, maar welke afhankelijkheid de agentactie heeft gebroken. Dat kan een permissie zijn, een throttlingprobleem, een mislukte toolaanroep of een overdracht tussen agents. De uitkomst is een getraceerde oorzaak met herstelstappen, niet alleen een alarm.

Van uptime naar aantoonbaar gedrag

De eerdere AWS-aankondiging waarin AgentCore algemeen beschikbaar werd en Guardrails menselijke controle rond agentacties plaatste ging over de vraag wie een agent mag laten handelen. Deze nieuwe stap gaat over wat er na die livegang zichtbaar moet blijven: kwaliteitsscores én een herleidbare technische oorzaak.

Een productie-agent is daarmee pas bestuurbaar wanneer twee vragen tegelijk beantwoord kunnen worden: deed hij technisch wat hij moest doen, en hielp hij de gebruiker zijn doel te bereiken? AWS zet die twee vragen nu naast elkaar in één operationele lus.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Productie vraagt om zicht

Ik help je AI-agents van ontwerp tot livegang betrouwbaar inrichten: ik denk mee over de taak, ontwerp de controlelaag, bouw de koppelingen en automatiseer het beheer. Waar het kan self-hosted, zodat je zicht houdt op data, kosten en gedrag.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

OpenAI zet Daybreak-cybermodellen op Amazon Bedrock, alleen in de VS
Nieuws
4 min

12 aug 02:11

OpenAI zet Daybreak-cybermodellen op Amazon Bedrock, alleen in de VS

Daybreak Blue en Red zijn nu via Amazon Bedrock af te nemen, maar uitsluitend in de regio Noord-Virginia en alleen na goedkeuring in Trusted Access for Cyber. Dat verschuift de inkoopvraag voor bedrijven op AWS.

AWS laat Superblocks binnen de eigen cloudomgeving van klanten draaien
Nieuws
4 min

4 aug 00:23

AWS laat Superblocks binnen de eigen cloudomgeving van klanten draaien

AWS en Superblocks laten door AI gebouwde interne apps volledig binnen de eigen cloudomgeving van de klant draaien. Data, opslag en modelaanroepen blijven binnen de beveiligingsgrens, en een router kiest per taak het goedkoopste model.

Amazon Quick maakt desktopapp algemeen beschikbaar
Nieuws
4 min

11 sep 04:11

Amazon Quick maakt desktopapp algemeen beschikbaar

Amazon Quick is nu algemeen beschikbaar als zelfstandige desktopapp voor macOS en Windows. De nieuwe mobiele Activity Feed bundelt mail, agenda, chat en CRM, terwijl agents routinewerk op de achtergrond afhandelen.

AWS maakt Pizza Bot open source voor achtergrondtaken van AI-agents
Nieuws
4 min

11 sep 02:16

AWS maakt Pizza Bot open source voor achtergrondtaken van AI-agents

AWS maakt Pizza Bot open source, een lokale inbox voor langlopende AI-agenttaken. Werk gaat door zonder open chat, terwijl goedkeuringen, toolactiviteiten en afgeronde resultaten in aparte wachtrijen terugkomen.

Qualcomm en Amazon bouwen meerdere AI-chipgeneraties voor AWS
Nieuws
4 min

8 sep 17:14

Qualcomm en Amazon bouwen meerdere AI-chipgeneraties voor AWS

Qualcomm en Amazon ontwerpen meerdere generaties maatwerkchips voor AWS-inferentie en optische datacenterverbindingen tot 1,6T. Een SEC-warrant koppelt de samenwerking aan maximaal 60 miljard dollar aan toekomstige aankopen, niet aan directe omzet.

Anthropic tekent in elf maanden voor 517 miljard dollar aan compute-contracten
Nieuws
4 min

7 sep 04:09

Anthropic tekent in elf maanden voor 517 miljard dollar aan compute-contracten

Anthropic legde in elf maanden voor 517 miljard dollar aan compute-contracten en minstens 14,8 gigawatt vast, telt The Information. Dat is bijna drie keer het bedrag dat het bedrijf zijn investeerders in december voorspiegelde.