Google heeft een toename waargenomen in kwaadaardige AI prompt-injectie aanvallen via openbare websites, maar stelt dat de aanvallen nog relatief eenvoudig van opzet zijn. Prompt-injectie is een techniek waarbij AI-systemen worden misleid door specifieke instructies. Directe prompt-injectie is een soort ‘jailbreak’ waarbij een gebruiker de AI rechtstreeks manipuleert om regels te omzeilen. Indirecte prompt-injectie werkt via verborgen instructies in externe data, zoals websites, e-mails of ontwikkelaarsbronnen, die de AI misleiden om beveiligingsmaatregelen te negeren en bijvoorbeeld data te stelen.

Onderzoekers van Google onderzochten hoe vaak en in welke mate deze indirecte prompt-injecties in de praktijk voorkomen. Ze analyseerden hiervoor snapshots van websites uit de Common Crawl-database op bekende patronen van prompt-injecties. Met behulp van het AI-model Gemini en handmatige controles werden valse positieven verwijderd. De gevonden voorbeelden varieerden van onschuldige grappen en pogingen om AI-agenten te ontmoedigen, tot SEO-optimalisatie en nuttige instructies voor AI-systemen.

Vanuit beveiligingsperspectief zijn de kwaadaardige prompt-injecties het meest relevant. Google ontdekte twee typen aanvallen: exfiltratie en destructie. Sommige websites bevatten prompts die AI instrueren om gegevens zoals IP-adressen en inloggegevens te verzamelen en deze naar een door de aanvaller opgegeven e-mailadres te sturen. Volgens de onderzoekers is de complexiteit van deze aanvallen echter laag en werden er geen geavanceerde methoden waargenomen, zoals die in 2025 door beveiligingsonderzoekers werden gepubliceerd. Dit wijst erop dat dergelijke technieken nog niet op grote schaal worden toegepast.

In de destructiecategorie probeerden sommige prompts AI te misleiden om alle bestanden op een apparaat te verwijderen, maar deze aanvallen lijken weinig kans van slagen te hebben. Ondanks het ontbreken van geavanceerde aanvallen constateerden de Google-experts een stijging van 32 procent in kwaadaardige prompt-injectie pogingen tussen november 2025 en februari 2026. Ze waarschuwen dat zowel het aantal als de complexiteit van deze aanvallen naar verwachting zal toenemen.

De bevindingen van Google zijn nader beschreven in hun analyse van AI-bedreigingen in het wild.