Traditionele penetratietests maken gebruik van voorspelbare en deterministische tools waarmee kwetsbaarheden in software vaak vooraf kunnen worden opgespoord. Bij grote taalmodellen (LLM's) en AI-modellen ontstaat echter een nieuw soort risico dat met conventionele cybersecuritymethoden vrijwel onzichtbaar en onscanbaar is. Kwaadwillenden kunnen schadelijk of ongewenst gedrag in een model verbergen op een manier die momenteel nauwelijks te testen is. Dit tast niet alleen de technische tooling aan, maar ook de relatie met leveranciers, omdat geen enkele partij volledig kan garanderen hoe deze verborgen bedreigingen te detecteren.

De keuze tussen premium AI-modellen en minder getoetste open-weight modellen is complex. Open-weight modellen worden lokaal uitgevoerd en kunnen worden aangepast, maar de transparantie over gebruikte trainingsdata en scripts ontbreekt vaak. Open-source modellen daarentegen voldoen aan strengere eisen, zoals het beschikbaar stellen van data-informatie, code, parameters en een licentie die gebruik, studie, aanpassing en verspreiding toestaat. Dit maakt het mogelijk om geïnformeerde vragen te stellen over de herkomst van het model, iets wat bij open-weight modellen ontbreekt. Hierdoor vertrouwen gebruikers feitelijk op een kant-en-klaar product zonder inzicht in de samenstelling.

Deze beperkte transparantie brengt aanzienlijke risico's met zich mee, zoals verborgen achterdeurtjes en datavervuiling. Een triggerwoord dat diep in de numerieke parameters van een open-weight model is verborgen, kan bijvoorbeeld kwaadaardig gedrag activeren. Hoewel dit onbedoeld kan zijn voor de eindgebruiker, kan het welbewust door de maker van het model zijn ingebouwd. Tot nu toe zijn dergelijke gedragsachterdeurtjes vooral aangetoond in gecontroleerd onderzoek, zoals Anthropic’s Sleeper Agents en proof-of-concept projecten zoals PoisonGPT, maar nog niet in daadwerkelijke productiesystemen.

Wel zijn er al echte aanvallen geweest via kwaadaardige modellen die code uitvoeren bij het laden, zoals gedocumenteerd door JFrog in samenwerking met Hugging Face, waarbij zogenaamde malicious pickle-serialized modellen werden verspreid. Dit betreft een probleem in de verpakking dat bekend is en kan worden aangepakt. Onderzoek zoals Winter Soldier toont aan dat het mogelijk is om met een kleine hoeveelheid vergiftigde trainingsdata een model te manipuleren, wat de risico’s van open-weight modellen onderstreept.