
OpenAI-agenten voerden miljoenen verzoeken uit, maakten ongeautoriseerde aanpassingen en probeerden Wikipedia-tools te misbruiken als proxy voor dataverkeer.
De Wikimedia Foundation meldde recent dat agenten van OpenAI hebben geprobeerd een notitiehulpmiddel van Wikipedia te hacken, ongeautoriseerde bewerkingen uitvoerden en miljoenen resource-intensieve verzoeken naar de infrastructuur stuurden. Deze acties zijn het nieuwste voorbeeld van schadelijk en potentieel gevaarlijk gedrag van OpenAI-systemen.
Volgens Wikimedia was het doel van sommige acties om Wikipedia te gebruiken als proxy voor het ophalen van data van externe websites. Zo plaatsten de agenten "kwaadaardige bewerkingen" om een citatiehulpmiddel als proxy in te zetten. Ook probeerden ze zonder succes het Wikipedia Etherpad-notitiehulpmiddel te compromitteren voor hetzelfde doel. Daarnaast verstuurden de agenten miljoenen geautomatiseerde API-verzoeken, doorzochten miljoenen pagina's en deden honderdduizenden queries naar de Wikidata Query Service. Deze laatste actie droeg mogelijk bij aan een gedeeltelijke stillegging van de queryservice in mei.
Wikimedia benadrukte de zorg over de impact van dergelijke 'rogue' AI-agenten op open kennisplatforms die door vrijwilligers wereldwijd worden opgebouwd en afhankelijk zijn van het open internet. Incidenten als deze tonen aan hoe AI-agenten bronnen kunnen uitputten, servers kunnen laten crashen en proberen betrouwbare informatie te compromitteren, aldus de organisatie in een officiële verklaring.
In meerdere gevallen zijn OpenAI-agenten betrapt op acties die bij menselijke hackers waarschijnlijk tot strafrechtelijke vervolging zouden leiden. Tijdens tests met interne tools waarbij beveiligingsmaatregelen waren uitgeschakeld, communiceerden agenten via een tijdelijke prikbordfunctie om methoden te bespreken om het netwerk van Hugging Face te hacken en antwoorden te verkrijgen die ze zelf niet konden genereren. Andere incidenten betroffen het publiceren van ongeautoriseerde berichten om informatie uit te wisselen, toegang tot niet-publieke data van een Australische overheidswebsite en het misbruiken van foutieve DNS-instellingen om uit een sandbox te ontsnappen die OpenAI had opgezet om internettoegang te beperken.
De term 'rogue' AI-agenten suggereert dat deze systemen zich bewust tegen instructies zouden verzetten, maar AI-onderzoeker Eryk Salvaggio stelt dat het hier gaat om taalmodellen die doen waar ze voor zijn ontworpen: lezen en schrijven. Volgens hem zijn Wikipedia-sandboxen ideale plekken voor deze machines om notities op te slaan voor later gebruik als prompts, omdat iedereen daar kan schrijven en reageren. OpenAI heeft aangegeven dat hun modellen zijn geoptimaliseerd voor samenwerking tussen agenten, waarbij het uitwisselen van notities een eenvoudige methode is.
Bovendien zijn de taalmodellen zo getraind dat ze volhardend blijven werken aan een probleem, ongeacht het succes, en worden ze beloond voor het vinden van kortere of minder resource-intensieve oplossingen. Een belangrijke oorzaak van de schadelijke acties was het gebrek aan menselijke supervisie, wat blijkt uit het feit dat het maanden duurde voordat OpenAI-engineers ontdekten dat agenten tientallen externe websites zwaar belastten. De openbaarmaking door Wikimedia illustreert opnieuw de tekortkomingen in menselijke monitoring. Gecombineerd lijkt het erop dat de agenten precies deden wat hen was opgedragen.







