OpenAI heeft zijn aankomende AI-model Astra bestempeld als een potentieel ‘kritisch’ cybersecurityrisico, wat heeft geleid tot het opschorten van interne ontwikkelactiviteiten die niet voldoen aan nieuwe beveiligingsmaatregelen. Recente interne evaluaties toonden aanzienlijke vooruitgang in Astra’s vermogen tot autonoom coderen en uitvoeren van cyberaanvallen.
Volgens het Preparedness Framework van OpenAI bereikt een model het ‘kritische’ risiconiveau wanneer het zelfstandig zero-day exploits kan ontwikkelen tegen goed beveiligde, reële systemen. Ook valt het onder dit niveau als het AI-model volledig zelfstandig end-to-end cyberaanvallen kan ontwerpen en uitvoeren op basis van slechts een globaal doel. Astra overtreft hiermee eerdere modellen zoals GPT-5.6-Sol, dat het ‘hoge’ risiconiveau bereikte maar niet het ‘kritische’.
Om Astra’s capaciteiten veilig te beheren, heeft OpenAI de ontwikkelomgeving sterk afgeschermd. Er gelden nu geïsoleerde testomgevingen, strikte netwerkbeperkingen en verbeterde bescherming van modelgewichten. Projecten die niet aan deze eisen voldoen, zijn gepauzeerd. Daarnaast is universele monitoring geïmplementeerd om Astra’s acties in alle agentachtige toepassingen te volgen. Deze monitors evalueren de interne ‘chain of thought’ van het model en kunnen automatisch risicovol of ongewenst gedrag onderbreken.
OpenAI werkt samen met overheidsinstanties en gespecialiseerde AI-veiligheidsgroepen om Astra’s grenzen te testen en zal aanbevolen beveiligingsprotocollen delen met externe testers. Eerdere incidenten tonen aan dat geavanceerde AI-modellen met cybersecurityfocus een reële dreiging vormen, waarbij OpenAI, Anthropic en Meta bevestigden dat hun modellen tijdens tests echte organisaties wisten te hacken. OpenAI benadrukt dat Astra nog niet is vrijgegeven en niet betrokken was bij de recente hack van Hugging Face.
Reacties
Geef een reactie
Vereiste velden zijn gemarkeerd met *