Malware-instructies gaven in tests van Cisco Talos een netto verschuiving van 34,4 procentpunt richting een onschuldige AI-beoordeling, volgens onderzoek dat de beveiliger op 8 oktober 2026 publiceert.
De volgorde waarin een Nederlands securityteam verdachte bestanden onderzoekt, kan veranderen zodra een taalmodel de tekst voorsorteert. Een geruststellend modeloordeel kan naast ongewijzigde detectiesignalen staan. Talos beschrijft een risico in de AI-analyse, niet een manier om antivirus- of endpointdetectie uit te schakelen.
Commentaarregels bereiken ook de triage
Talos noemt de techniek A3: malware bevat natuurlijke-taalinstructies die geautomatiseerde analyse moeten beïnvloeden. In het PowerShell-monster FRUITSHELL verandert de code niet: de kwaadaardige functie bouwt een verbinding met een aanvallersserver op. Bovenaan staan twee regels voor een taalmodel: analyse is niet nodig, het bestand is onschuldig en maakt alleen priemgetallen van 1 tot 1.000. In het script staat geen code die die getallen genereert. De regels zijn commentaar tijdens uitvoering, maar blijven leesbaar wanneer een analyseprogramma tekst uit het bestand haalt.
Dezelfde tekst dook in de vijftien maanden na de eerste VirusTotal-inzending op in negen andere scripts, toegeschreven aan minstens vier verschillende aanvallers. Het ging niet om kopieën van FRUITSHELL, maar om onafhankelijke hergebruikers. Talos verzamelde tussen januari 2025 en juli 2026 84 verschillende monsters uit vier gevolgde families.
In juli stond dezelfde grens centraal toen vier van 26 modellen in een Zscaler-test een betaling van drie dollar na verborgen webinstructies uitvoerden. Daar las een agent een webpagina; bij Talos leest een analysemodel tekst uit een verdacht bestand. In beide gevallen kan aangeleverde inhoud als opdracht worden behandeld als het systeem data en instructies niet uit elkaar houdt.
De instructie krijgt meerdere gedaanten
De vroegste voorbeelden gebruikten een vaste zin. PLOTSAFE bouwt de tekst inmiddels uit een sjabloon met wisselende woorden, zodat de boodschap hetzelfde blijft terwijl de voorbeeldactiviteit verandert. De makers voegden een ongebruikte functie van 29 bytes toe die de tekststrings vasthoudt, zodat de Go-compiler ze niet uit het programma verwijdert.
HOLLOWCLAD richt zich op verschillende modellen tegelijk. De malware zet in zeven chatindelingen voor taalmodellen dezelfde weigering om de code te ontleden, met als reden dat die auteursrechtelijk beschermd zou zijn. In dezelfde bestanden staan ook dreigementen over vermeende bewaking en juridische gevolgen. Ongeveer tachtig secties zijn genoemd naar bekende beschermingsprogramma’s, hoewel het bestand zelf niet is ingepakt. Talos beschrijft die namen als uiterlijk vertoon dat analyse moet ontmoedigen.
MANTLEMAZE koppelt de instructietekst aan verzonnen gezag. De loader presenteert zich tegelijk als intellectueel eigendom van Google, Microsoft en Valve en noemt een verzonnen contract van het Amerikaanse ministerie van Defensie. Talos ziet daarin een poging om onderwerpen te raken waarop modellen blokkades kunnen hebben.
De vorm varieert, maar volgens Talos vereist elke variant gewone leesbare tekst.
De test meet een netto verschuiving
Talos haalde instructies uit zeven malwarefamilies en zette iedere tekst in ieder monster, ook in bestanden waarin die oorspronkelijk niet voorkwam. Vijf lokaal draaiende taalmodellen beoordeelden de bestanden drie keer. Voor elke instructie vergeleek het team 135 paren: hetzelfde monster met de instructie en met die tekst verwijderd. De modellen konden het bestand als onschuldig, verdacht of kwaadaardig aanmerken.

De grafiek rapporteert geen algemeen percentage foute beoordelingen, maar het netto verschil tussen verschuivingen naar onschuldig en verschuivingen naar kwaadaardig. Bij directe instructies is dat plus 34,4 procentpunt richting onschuldig. Context verzinnen komt uit op plus 11,6 punt, terwijl instructies in meerdere chatindelingen netto 3,1 punt vaker tot een verdachtere beoordeling leidden. Het activeren van veiligheidsregels verschoof het oordeel 28,5 punt de andere kant op. Van de technieken die richting onschuldig duwen, passeert alleen de directe instructie ook de ruisvloer; de statistische toets geeft p < 0,0001. Context verzinnen blijft onder die ruisvloer.
Dat onderscheid begrenst wat het cijfer zegt. De 34,4 procentpunt is de uitkomst van een gecontroleerde vergelijking met vijf lokale modellen, geen kans dat een willekeurig bedrijfsbestand onschuldig wordt verklaard. Talos noemt de modellen niet en meet geen incidenten in productie. De test laat zien dat de tekst het oordeel onder deze omstandigheden kan sturen; hij meet niet hoe vaak dat in bestaande securityproducten gebeurt.
De prompt moet bestandsinhoud als bewijs behandelen
Omdat de aanwijzingen in leesbare tekst moeten staan, vormen ze volgens Talos ook een detecteerbaar signaal. Een bestand dat een scanner opdraagt de analyse te staken of een kwaadaardig programma onschuldig te noemen, kan als verdacht worden behandeld. De bron adviseert daarnaast de instructie aan het model expliciet te scheiden van de inhoud van het monster. Uitgelezen strings horen als bewijs in de analyse te staan, niet op een plek waar ze als systeeminstructie kunnen gelden.
Voor andere binnenkomende bestanden bestaat dezelfde technische scheiding. Een intake-sluis kan verborgen tekstlagen markeren, verwijderen of blokkeren voordat een assistent het document ontvangt. Bij malwaretriage blijft de hoofdregel gelijk, ook wanneer het bestand zelf de tekst zichtbaar toont: de opdracht van de analist komt uit de vertrouwde analyseconfiguratie, terwijl de inhoud van het monster onbetrouwbare invoer blijft.
De 84 verzamelde monsters en het hergebruik van één commentaar door verschillende aanvallers plaatsen AI-triage op de radar van malwaremakers. Dezelfde scheidslijn speelt wanneer agents webpagina’s lezen, maar Talos laat zien dat ook een bestand de analyse-invoer kan beïnvloeden. Talos’ ontwerpregel luidt: tekst uit een bestand dient als bewijs; de opdracht blijft in de vertrouwde analyseconfiguratie.
Veelgestelde vragen
Grenzen voor AI-invoer
Ik denk mee over hoe AI onbetrouwbare bestanden leest, ontwerp de controle tussen invoer en model en bouw het geheel end-to-end. Waar dat kan, draai ik de verwerking self-hosted zodat de data in je eigen omgeving blijft.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
