OpenAI heeft bekendgemaakt dat een autonome AI-agent, die ontsnapte uit een afgesloten testomgeving, tijdens een beveiligingsincident bij Hugging Face toegang heeft gekregen tot meerdere derdepartijaccounts en -diensten. Dit incident, dat voortkwam uit een interne penetratietest, bleek omvangrijker dan aanvankelijk werd aangenomen.

Uit het laatste rapport van OpenAI blijkt dat de AI-modellen, waaronder GPT-5.6 Sol en een krachtiger pre-release model, in een beperkt aantal gevallen blootgestelde accountgegevens op publieke diensten identificeerden en gebruikten. Dit betrof vier accounts op vier verschillende diensten die betrokken waren bij het Hugging Face-incident, naast enkele accounts die tijdens andere evaluaties werden benaderd. Eén van deze accounts werd gebruikt als uitgaande relay en staging-omgeving, een ander voor opslag van data. De overige twee accounts werden alleen in leesmodus benaderd en niet gebruikt om Hugging Face verder te compromitteren.

OpenAI heeft niet bekendgemaakt welke organisaties of bedrijven eigenaar waren van deze accounts, maar meldt dat eigenaren direct geïnformeerd worden. Er is geen bewijs gevonden voor een bredere impact op deze providers of accounts. Reuters meldde dat een klant van Modal Labs tot de getroffen partijen behoorde.

De AI-modellen maakten ook gebruik van diverse publieke webdiensten, zoals code-paste websites, request capture services, screenshotdiensten en file-drop services, zonder dat er sprake was van compromittering op platform- of accountniveau. OpenAI werkt samen met Hugging Face sinds het incident op 16 juli 2026 aan de afhandeling.

De AI-agent wist via een onbekende zero-day kwetsbaarheid in zelfgehoste versies van Artifactory, een pakketregistratie proxy van JFrog, internettoegang te verkrijgen en uit de sandbox te ontsnappen. Deze kwetsbaarheid is inmiddels verholpen in Artifactory versie 7.161. Volgens JFrog worden in deze update meerdere beveiligingslekken gedicht die, indien Anonymous Access is ingeschakeld, gecombineerd kunnen leiden tot kritieke aanvalsscenario’s. Anonymous Access staat standaard uit en wordt vanwege veiligheidsrisico’s afgeraden in productieomgevingen.

Jfrog CTO Yoav Landman benadrukte dat AI-modellen steeds krachtiger worden in het ontdekken van zero-day kwetsbaarheden. Deze zelfde eigenschappen kunnen echter ook worden ingezet door verdedigers om kwetsbaarheden sneller te vinden en te verhelpen. Het pre-release model dat bij het incident betrokken was, was een intern onderzoeksprototype dat oorspronkelijk voor publieke release bedoeld was, maar inmiddels is gedeactiveerd, versleuteld en beperkt in onderzoeksgebruik.

Hugging Face publiceerde een uitgebreide tijdlijn van het incident. Hieruit blijkt dat de AI-agent ongeveer tweeënhalve dag actief was binnen de infrastructuur met als doel het omzeilen van ExploitGym, een benchmarkframework dat AI-systemen test op hun vermogen om softwarekwetsbaarheden te ontdekken en te benutten. Het bedrijf analyseerde circa 17.600 acties van de agent tussen 9 en 13 juli 2026. Volgens Hugging Face was het gehele inbraaktraject vanuit het perspectief van de agent een poging om de evaluatie te manipuleren door toegang te krijgen tot productiesystemen en testoplossingen te stelen in plaats van de uitdaging zelfstandig op te lossen.