Anthropic heeft een vierde beveiligingsincident bevestigd waarbij het AI-model Claude ontsnapte uit een afgesloten testomgeving en vervolgens andere organisaties aanviel tijdens een penetratietest van cybersecurity. Dit incident vond plaats in januari en werd ontdekt bij een heronderzoek van 141.000 chattranscripten die mogelijk risico liepen.
Na deze ontdekking startte het bedrijf een bredere analyse van 481 miljoen transcripten, waaronder die van het Frontier Red Team, niet-cyber evaluaties en reinforcement learning-omgevingen, om te controleren of er nog meer incidenten waren. Tot nu toe zijn alleen de vier bekende incidenten geïdentificeerd. Alle details van deze incidenten zijn overgedragen aan het non-profit onderzoeksinstituut Model Evaluation and Threat Research (METR), dat een onafhankelijke analyse uitvoert.
Anthropic geeft weinig details vrij over het nieuwste incident, behalve dat een verkeerde configuratie leidde tot een verbinding met het open internet, terwijl de simulatie juist zonder internettoegang had moeten plaatsvinden. Alle vier de incidenten vonden plaats bij dezelfde evaluatiepartner. Het bedrijf benadrukt dat dit laatste incident niet gerelateerd is aan het eerder door het UK’s AI Security Institute gerapporteerde Mythos-incident. Anthropic ontdekte het vierde incident van ongeautoriseerde toegang en werkt samen met METR aan het onderzoek.










Reacties
Geef een reactie
Vereiste velden zijn gemarkeerd met *