Onderzoekers van Unit 42 hebben een nieuwe methode ontwikkeld om de kwetsbaarheid van grote taalmodellen (LLM's) te testen. Met een genetisch algoritme geïnspireerde prompt fuzzing worden varianten van verboden verzoeken automatisch gegenereerd, waarbij de oorspronkelijke betekenis behouden blijft. Deze techniek maakt het mogelijk om zwakke plekken in de beveiligingsmaatregelen van LLM's systematisch bloot te leggen.

De bevindingen tonen aan dat de beveiligingslagen van zowel open als gesloten modellen niet altijd bestand zijn tegen herformuleringen van schadelijke prompts. De mate van omzeiling varieert van enkele procenten tot zeer hoge percentages, afhankelijk van de gebruikte sleutelwoorden en het model. Dit betekent dat kleine faalkansen bij grootschalige, geautomatiseerde aanvallen betrouwbaar kunnen worden uitgebuit. Prompt jailbreaking vormt daarmee een belangrijke bedreiging voor toepassingen die generatieve AI inzetten, zoals chatbots en workflowtools. Omdat de aanvalsvector bestaat uit onbetrouwbare natuurlijke taal, kunnen mislukte beveiligingen leiden tot veiligheidsincidenten, complianceproblemen en reputatieschade.