Werkplek met meerdere schermen waarop code staat.
Nieuws8 oktober · 14:135 min leestijd

Talos meet hoe malware AI-triage naar onschuldig stuurt

Cisco Talos test hoe malware-instructies AI-triage beïnvloeden. Bij directe instructies verschoof het netto oordeel 34,4 procentpunt richting onschuldig. De klassieke detectie bleef volgens Talos buiten bereik van de techniek.

Malware-instructies gaven in tests van Cisco Talos een netto verschuiving van 34,4 procentpunt richting een onschuldige AI-beoordeling, volgens onderzoek dat de beveiliger op 8 oktober 2026 publiceert.

De volgorde waarin een Nederlands securityteam verdachte bestanden onderzoekt, kan veranderen zodra een taalmodel de tekst voorsorteert. Een geruststellend modeloordeel kan naast ongewijzigde detectiesignalen staan. Talos beschrijft een risico in de AI-analyse, niet een manier om antivirus- of endpointdetectie uit te schakelen.

Commentaarregels bereiken ook de triage

Talos noemt de techniek A3: malware bevat natuurlijke-taalinstructies die geautomatiseerde analyse moeten beïnvloeden. In het PowerShell-monster FRUITSHELL verandert de code niet: de kwaadaardige functie bouwt een verbinding met een aanvallersserver op. Bovenaan staan twee regels voor een taalmodel: analyse is niet nodig, het bestand is onschuldig en maakt alleen priemgetallen van 1 tot 1.000. In het script staat geen code die die getallen genereert. De regels zijn commentaar tijdens uitvoering, maar blijven leesbaar wanneer een analyseprogramma tekst uit het bestand haalt.

Dezelfde tekst dook in de vijftien maanden na de eerste VirusTotal-inzending op in negen andere scripts, toegeschreven aan minstens vier verschillende aanvallers. Het ging niet om kopieën van FRUITSHELL, maar om onafhankelijke hergebruikers. Talos verzamelde tussen januari 2025 en juli 2026 84 verschillende monsters uit vier gevolgde families.

In juli stond dezelfde grens centraal toen vier van 26 modellen in een Zscaler-test een betaling van drie dollar na verborgen webinstructies uitvoerden. Daar las een agent een webpagina; bij Talos leest een analysemodel tekst uit een verdacht bestand. In beide gevallen kan aangeleverde inhoud als opdracht worden behandeld als het systeem data en instructies niet uit elkaar houdt.

De instructie krijgt meerdere gedaanten

De vroegste voorbeelden gebruikten een vaste zin. PLOTSAFE bouwt de tekst inmiddels uit een sjabloon met wisselende woorden, zodat de boodschap hetzelfde blijft terwijl de voorbeeldactiviteit verandert. De makers voegden een ongebruikte functie van 29 bytes toe die de tekststrings vasthoudt, zodat de Go-compiler ze niet uit het programma verwijdert.

HOLLOWCLAD richt zich op verschillende modellen tegelijk. De malware zet in zeven chatindelingen voor taalmodellen dezelfde weigering om de code te ontleden, met als reden dat die auteursrechtelijk beschermd zou zijn. In dezelfde bestanden staan ook dreigementen over vermeende bewaking en juridische gevolgen. Ongeveer tachtig secties zijn genoemd naar bekende beschermingsprogramma’s, hoewel het bestand zelf niet is ingepakt. Talos beschrijft die namen als uiterlijk vertoon dat analyse moet ontmoedigen.

MANTLEMAZE koppelt de instructietekst aan verzonnen gezag. De loader presenteert zich tegelijk als intellectueel eigendom van Google, Microsoft en Valve en noemt een verzonnen contract van het Amerikaanse ministerie van Defensie. Talos ziet daarin een poging om onderwerpen te raken waarop modellen blokkades kunnen hebben.

De vorm varieert, maar volgens Talos vereist elke variant gewone leesbare tekst.

De test meet een netto verschuiving

Talos haalde instructies uit zeven malwarefamilies en zette iedere tekst in ieder monster, ook in bestanden waarin die oorspronkelijk niet voorkwam. Vijf lokaal draaiende taalmodellen beoordeelden de bestanden drie keer. Voor elke instructie vergeleek het team 135 paren: hetzelfde monster met de instructie en met die tekst verwijderd. De modellen konden het bestand als onschuldig, verdacht of kwaadaardig aanmerken.

Grafiek van Cisco Talos met de netto verschuiving per instructietype, Cisco Talos
Grafiek van Cisco Talos met de netto verschuiving per instructietype, Cisco Talos

De grafiek rapporteert geen algemeen percentage foute beoordelingen, maar het netto verschil tussen verschuivingen naar onschuldig en verschuivingen naar kwaadaardig. Bij directe instructies is dat plus 34,4 procentpunt richting onschuldig. Context verzinnen komt uit op plus 11,6 punt, terwijl instructies in meerdere chatindelingen netto 3,1 punt vaker tot een verdachtere beoordeling leidden. Het activeren van veiligheidsregels verschoof het oordeel 28,5 punt de andere kant op. Van de technieken die richting onschuldig duwen, passeert alleen de directe instructie ook de ruisvloer; de statistische toets geeft p < 0,0001. Context verzinnen blijft onder die ruisvloer.

Dat onderscheid begrenst wat het cijfer zegt. De 34,4 procentpunt is de uitkomst van een gecontroleerde vergelijking met vijf lokale modellen, geen kans dat een willekeurig bedrijfsbestand onschuldig wordt verklaard. Talos noemt de modellen niet en meet geen incidenten in productie. De test laat zien dat de tekst het oordeel onder deze omstandigheden kan sturen; hij meet niet hoe vaak dat in bestaande securityproducten gebeurt.

De prompt moet bestandsinhoud als bewijs behandelen

Omdat de aanwijzingen in leesbare tekst moeten staan, vormen ze volgens Talos ook een detecteerbaar signaal. Een bestand dat een scanner opdraagt de analyse te staken of een kwaadaardig programma onschuldig te noemen, kan als verdacht worden behandeld. De bron adviseert daarnaast de instructie aan het model expliciet te scheiden van de inhoud van het monster. Uitgelezen strings horen als bewijs in de analyse te staan, niet op een plek waar ze als systeeminstructie kunnen gelden.

Voor andere binnenkomende bestanden bestaat dezelfde technische scheiding. Een intake-sluis kan verborgen tekstlagen markeren, verwijderen of blokkeren voordat een assistent het document ontvangt. Bij malwaretriage blijft de hoofdregel gelijk, ook wanneer het bestand zelf de tekst zichtbaar toont: de opdracht van de analist komt uit de vertrouwde analyseconfiguratie, terwijl de inhoud van het monster onbetrouwbare invoer blijft.

De 84 verzamelde monsters en het hergebruik van één commentaar door verschillende aanvallers plaatsen AI-triage op de radar van malwaremakers. Dezelfde scheidslijn speelt wanneer agents webpagina’s lezen, maar Talos laat zien dat ook een bestand de analyse-invoer kan beïnvloeden. Talos’ ontwerpregel luidt: tekst uit een bestand dient als bewijs; de opdracht blijft in de vertrouwde analyseconfiguratie.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Grenzen voor AI-invoer

Ik denk mee over hoe AI onbetrouwbare bestanden leest, ontwerp de controle tussen invoer en model en bouw het geheel end-to-end. Waar dat kan, draai ik de verwerking self-hosted zodat de data in je eigen omgeving blijft.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

116 bedrijven roepen op tot gezamenlijke verdediging tegen AI-aanvallen
Nieuws
5 min

27 aug 20:11

116 bedrijven roepen op tot gezamenlijke verdediging tegen AI-aanvallen

OpenAI, Anthropic, Google, Microsoft en 112 andere bedrijven waarschuwen in een open brief dat het venster om cyberdefensie te versterken nog maar maanden duurt. Wat er concreet van elke organisatie wordt gevraagd.

Broadcom lanceert VMware Private AI Cloud met meer dan 150 modellen op eigen infrastructuur
Nieuws
6 min

31 aug 16:47

Broadcom lanceert VMware Private AI Cloud met meer dan 150 modellen op eigen infrastructuur

Broadcom bundelt AI-inferentie, agents en klassieke workloads op VMware Cloud Foundation en valideert vijf modellen voor eigen datacenters. AgentMinder is er nu, de AI Gateway en de agentbeveiliging volgen later.

Google draagt A2A over aan de Agentic AI Foundation, naast MCP
Nieuws
5 min

18 aug 02:10

Google draagt A2A over aan de Agentic AI Foundation, naast MCP

Het Agent2Agent-protocol van Google komt als hosted project onder de Agentic AI Foundation, dezelfde stichting die MCP beheert. Daarmee staan de twee dragende agent-protocollen onder neutraal bestuur.

Agent Plugins 1.0 maakt agentuitbreidingen draagbaar tussen ChatGPT, Copilot en VS Code
Nieuws
4 min

7 aug 12:24

Agent Plugins 1.0 maakt agentuitbreidingen draagbaar tussen ChatGPT, Copilot en VS Code

Amazon, Cursor, Microsoft, OpenAI en Vercel publiceerden een open pakketformaat voor Agent Skills en MCP-servers. Google sluit aan als core maintainer. Je bouwt een agentuitbreiding voortaan een keer, niet per client.

FCC werkt aan importverbod op nieuwe Chinese optische transceivers
Nieuws
4 min

4 aug 22:10

FCC werkt aan importverbod op nieuwe Chinese optische transceivers

De Amerikaanse FCC werkt aan een importverbod op nieuwe modellen Chinese optische transceivers, de modules die data binnen datacenters over glasvezel verplaatsen. Reuters meldt het op basis van vier ingewijden. Er ligt nog geen besluit.

Amerikaanse AI splitst in twee lagen, en de NSA trekt de grens
Signaal
7 min

2 aug 00:02

Amerikaanse AI splitst in twee lagen, en de NSA trekt de grens

Westerse labs publiceren meer modelgewichten dan ooit, terwijl hun topmodellen eerst naar Washington gaan. Sinds Executive Order 14409 loopt er een geheime NSA-drempel tussen die twee lagen.