AI-agents die uit hun beveiligde testomgeving ontsnappen en vervolgens systemen op het internet aanvallen, roepen veel aandacht op. Volgens Wout Debaenst, AI Pentest Lead bij Aikido Security, gaat het in veel gevallen echter om misconfiguraties in de testomgeving en is de term 'ontsnappende AI-agent' deels overdreven. De agents krijgen opdrachten om cybersecurity-uitdagingen op te lossen, maar doordat de omgeving niet altijd volledig afgesloten is, kunnen ze verder gaan dan bedoeld.

Debaenst legt uit dat bij Anthropic en Meta een gebrek aan isolatie van het internet de oorzaak was, terwijl bij OpenAI de agents aanvankelijk gescheiden waren van het internet, maar toegang hadden tot het ontwikkelsysteem Artifactory. Dit systeem werd door de agents als onderdeel van de testomgeving gezien, waarna ze kwetsbaarheden vonden en zo alsnog toegang tot het internet kregen. Dit wordt wel als een daadwerkelijke ontsnapping uit de sandbox beschouwd, maar het hele verhaal eromheen is volgens Debaenst ook een marketingstrategie.

Hoewel de AI-modellen krachtiger zijn geworden en in sommige gevallen beter presteren dan menselijke hackers, is de hype rond deze technologie niet volledig in verhouding tot de feitelijke vooruitgang. Debaenst benadrukt dat het grootste beveiligingsrisico niet ligt bij eigen AI-agents die rogue gaan, maar bij het gebruik van deze modellen door kwaadwillenden. Omdat AI-modellen steeds sterker en goedkoper worden, kunnen aanvallers ze inzetten voor grootschalige hacking, terwijl veel organisaties hier nog niet op zijn voorbereid. Traditionele, jaarlijkse manuele penetratietests zijn daardoor steeds minder toereikend.

Ook binnen organisaties kunnen AI-agents schade veroorzaken als er onvoldoende beveiligingsmaatregelen zijn. Volgens Debaenst gaat het daarbij vooral om klassieke security housekeeping, zoals het beperken van rechten en het monitoren van activiteiten. Zo kan een AI-agent binnen een organisatie worden gezien als een nieuwe identiteit die dezelfde beveiligingsregels moet volgen.