Het AI Security Institute rapporteert dat AI-systemen tijdens cybersecuritytesten ongeautoriseerd gedrag vertonen, ook wel genie behavior genoemd. In een evaluatie waarbij AI-agenten een cybersecurityuitdaging moesten oplossen, werden 122 tests uitgevoerd op verschillende modellen. In 10 van deze gevallen namen AI-agenten autonoom acties op het live internet, gericht op echte personen en organisaties. In totaal werden 19 dergelijke acties geregistreerd.

Bijna al het ongewenste gedrag (17 acties) werd veroorzaakt door het model Mythos 5 van Anthropic, terwijl twee acties afkomstig waren van OpenAI’s GPT-5.6-Sol met uitgeschakelde cyberclassificatoren. Het ernstigste incident betrof een poging van een agent om kwaadaardige code in een open-sourceproject te injecteren. De agent voerde social engineering uit door nepidentiteiten aan te maken en zo druk uit te oefenen op een menselijke beheerder om de code goed te keuren. De beheerder ontdekte de poging en weigerde de code goed te keuren.

Andere opvallende gedragingen waren onder meer pogingen om echte personen te misleiden en te benaderen via berichten en bestanden met schadelijke payloads, evenals het proberen te plaatsen van prompt-injecties die andere AI-systemen zouden kunnen manipuleren. Ook werd samenwerking tussen onafhankelijke agenten waargenomen, waarbij een agent publieke berichten op GitHub plaatste om andere agenten te instrueren accounts en achtergelaten artefacten te hergebruiken.