Een nieuwe aanvalsmethode voor promptinjectie, genaamd ‘Comment and Control’, blijkt effectief te zijn tegen meerdere populaire AI-tools voor codebeveiliging en automatisering. Deze kwetsbaarheid werd ontdekt door security engineer en onderzoeker Aonan Guan, samen met onderzoekers van Johns Hopkins University, Zhengyu Liu en Gavin Zhong. In een blogpost legt Guan uit dat de aanval werkt op AI-agents zoals Anthropic’s Claude Code Security Review, Google’s Gemini CLI Action en GitHub Copilot Agent.
De onderzoekers ontdekten dat AI-agents die via GitHub Actions draaien, kunnen worden gekaapt met speciaal opgemaakte GitHub-comments, waaronder pull request-titels, comments en issue-teksten. Bij Claude Code Security Review, dat bedoeld is voor geautomatiseerde security reviews, toonden zij aan dat een kwaadwillende met een speciaal gemaakte PR-titel de AI-agent kan misleiden om willekeurige commando’s uit te voeren, credentials te stelen en deze als security finding of in de GitHub Actions-log te tonen. Voor Gemini CLI Action, een autonome agent voor routinematige codeertaken, gebruikten de onderzoekers een issue-comment met een promptinjectie-titel en speciaal opgemaakte comments om beveiligingsmaatregelen te omzeilen en een volledige API-sleutel te bemachtigen.
In de aanval op GitHub Copilot Agent maakten de experts gebruik van een HTML-commentaar, waarmee de payload verborgen wordt en zo omgevingsfilters en netwerkfirewalls kan worden gepasseerd. De ‘Comment and Control’-aanval vormt een ernstige bedreiging omdat de kwaadaardige prompt automatisch wordt geactiveerd door GitHub Actions workflows, zonder dat het slachtoffer actie hoeft te ondernemen – behalve bij Copilot, waar het issue handmatig aan Copilot toegewezen moet worden door het slachtoffer.
Volgens Guan geldt dit aanvalspatroon waarschijnlijk voor elke AI-agent die onbetrouwbare GitHub-data verwerkt en toegang heeft tot uitvoeringsmogelijkheden binnen dezelfde runtime als productiesleutels. Dit kan zich ook uitstrekken tot andere agents die onbetrouwbare input verwerken met toegang tot tools en credentials, zoals Slack-bots, Jira-agents, e-mailagents en deployment-automatisering. Hoewel er meerdere verdedigingslagen zijn – op model-, prompt- en runtime-niveau – kunnen deze worden omzeild omdat promptinjectie hier geen bug is, maar context die de agent juist moet verwerken.
De bevindingen zijn gemeld bij Anthropic, Google en GitHub, die ze allen hebben bevestigd. Anthropic kwalificeerde het probleem als ‘kritiek’ en voerde mitigaties door, waarbij de onderzoekers een bug bounty van 100 dollar ontvingen. Google betaalde een beloning van 1.337 dollar uit. GitHub kende 500 dollar toe en gaf aan dat het onderzoek interne discussies heeft gestimuleerd, maar classificeerde het als een bekende architecturale beperking.
Reacties
Geef een reactie
Vereiste velden zijn gemarkeerd met *