Een recent uitgevoerde penetratietest op een AI-assistent, aangeduid als "EduBot", die door een overheidsinstantie wordt ingezet om vragen over onderwijs te beantwoorden, heeft belangrijke inzichten opgeleverd over de beveiliging van dergelijke systemen. Deze test werd uitgevoerd als een zogenoemde "black box" beoordeling, waarbij de tester alleen toegang had tot de output van het systeem en geen kennis had van de interne architectuur of prompts. Dit maakt het een realistische test van de beveiligingsmaatregelen van de AI.

Het systeem was ontworpen met strikte domeinbeperkingen: het mocht alleen vragen over onderwijs beantwoorden, andere verzoeken moesten worden geweigerd, en het moest een beleefde en behulpzame toon behouden. De test richtte zich op kwetsbaarheden uit de OWASP Top 10 voor LLMs, met name promptinjectie, onveilige outputverwerking en jailbreakpogingen. In de eerste fase, gericht op verkenning, werden directe en vermomde opdrachten geprobeerd, zoals het overschrijven van instructies en het aannemen van een fictieve rol, maar het systeem weigerde consequent ongewenste opdrachten uit te voeren. Dit duidt op een robuuste instructiehiërarchie en een semantische filter die ook intentie herkent.

In de tweede fase werd geprobeerd om via cognitieve manipulatie het systeem te misleiden door schadelijke verzoeken te verpakken als educatieve opdrachten. Bijvoorbeeld het vragen om een voorbeeld van een ongeschikte tekst voor een burgerschapsles. Ook deze pogingen werden geblokkeerd, wat aangeeft dat de contentveiligheidsfilters zwaarder wegen dan het streven om behulpzaam te zijn. Het systeem weigerde expliciet het genereren van bedreigingen of grove teksten, ongeacht de context.

De test toonde daarmee aan dat het AI-systeem effectief beschermt tegen directe, contextuele en taalkundige manipulaties. De casus illustreert echter ook dat semantische beveiligingen kwetsbaar kunnen zijn voor structurele manipulaties, een aspect dat in de derde fase van het onderzoek nader werd onderzocht. Deze bevindingen benadrukken het belang van een gelaagde beveiligingsaanpak bij AI-systemen, zeker wanneer ze worden ingezet voor publieke dienstverlening.