Aanvallers zetten steeds vaker AI-agents in om cyberaanvallen te automatiseren, wat de beveiligingsindustrie dwingt tot nieuwe verdedigingsmethoden. Een veelbelovende techniek is het bewust plaatsen van lokbestandjes met prompts die de contentveiligheidsmaatregelen van grote taalmodellen (LLM's) activeren, waardoor kwaadaardige AI-workflows vroegtijdig worden afgebroken.

Het gebruik van lokmiddelen, ook wel canaries genoemd, is niet nieuw in cybersecurity. Dit kunnen valse documenten, AWS-sleutels, database dumps, DNS-records of URLs zijn die normale processen niet zouden opvragen, maar aantrekkelijk zijn voor aanvallers. Wat nieuw is aan deze aanpak van beveiligingsbedrijf Tracebit is dat deze lokmiddelen niet alleen waarschuwen, maar ook daadwerkelijk AI-agents stoppen, waardoor verdedigers meer tijd krijgen.

Deze methode, context bombing genoemd, maakt gebruik van de kwetsbaarheid van LLM's voor promptinjectie. AI-agents kunnen namelijk instructies tegenkomen in de data die ze verwerken, waardoor ze ongewenst gedrag kunnen vertonen. Organisaties die eigen AI-agents ontwikkelen, moeten rekening houden met kwaadaardige prompts die aanvallers kunnen plaatsen in webpagina's, e-mails, documenten of codecommentaren die de agents mogelijk benaderen. Zonder bescherming kunnen deze agents worden gekaapt en tegen de organisatie worden ingezet. Aanvallers gebruiken echter dezelfde kwetsbaarheid.

Sam Cox, CTO van Tracebit, legt in een blogpost uit dat een context bomb een korte tekst is die de veiligheidsmaatregelen van een model activeert en strategisch wordt geplaatst in het pad van de aanvaller, bijvoorbeeld als een valse geheime sleutel, omgevingsvariabele of DNS-record. Wanneer een AI-agent deze leest, weigert deze vaak door te gaan. Zo wordt niet alleen een waarschuwing gegenereerd, maar stopt de aanval ook vroegtijdig.

Tests van Tracebit in een AWS-omgeving tonen aan dat context bombing de succesratio van AI-gedreven aanvallen met maximaal 90 procent verlaagt door instructies toe te voegen die de contentveiligheidsmaatregelen activeren. LLM's zijn getraind om vragen over het maken van biologische, chemische of nucleaire wapens te weigeren, evenals gevoelige politieke onderwerpen zoals de Tiananmen Square-massamoord. Zodra zo’n verboden instructie in de context verschijnt, weigert het model doorgaans verder te gaan zonder handmatige tussenkomst.

De onderzoekers vonden korte tekststrings die betrouwbaar de veiligheidsmaatregelen triggeren, maar deze verschillen per model, waaronder Claude Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek V4 Pro en Kimi K2.6. Zonder context bombs behaalden AI-agents gemiddeld volledige beheerdersrechten in 54 procent van 154 aanvalspogingen en volledige compromittering in 36 procent. Met context bombs daalden deze cijfers naar respectievelijk 5 en 1 procent. Ook daalde het percentage aanvallen waarbij ten minste één van tien aanvalspaden succesvol werd afgerond van 91 naar 15 procent.

De modellen van Westerse AI-labs, Opus en Gemini, waren het meest succesvol in het verkrijgen van volledige beheerdersrechten (93 en 70 procent), maar werden ook het sterkst beïnvloed door context bombs, waarbij hun succesratio’s naar 0 procent daalden. Dit wijst op sterkere contentveiligheidsmaatregelen in deze modellen vergeleken met de geteste Chinese modellen.