OpenAI heeft GPT-6 Astra gelanceerd, het eerste model dat volgens het eigen Preparedness Framework de kritieke drempel voor cybersecurityrisico's overschrijdt. Dit betekent dat er extra beperkingen gelden voor de inzet van het model. Astra wordt vanaf de lancering beschikbaar gesteld aan een beperkte groep organisaties en zal in de komende dagen toegankelijk worden voor alle ChatGPT Plus, Pro, Business en Enterprise gebruikers, evenals via de OpenAI API en Amazon Web Services.
Toegang tot Astra is standaard uitgeschakeld en moet handmatig worden geactiveerd door enterprise-beheerders. Ontwikkelaars kunnen het model via de API benaderen onder de naam gpt-6-astra of via Amazon Bedrock, met een prijsstelling van 10 dollar per miljoen inputtokens en 50 dollar per miljoen outputtokens. Pro, Business en Enterprise gebruikers krijgen daarnaast toegang tot een variant genaamd Astra Pro. Voor in aanmerking komende API-klanten ondersteunt Astra Zero Data Retention, wat inhoudt dat er geen data wordt opgeslagen.
OpenAI testte Astra zonder productiesafeguardes op de ExploitBench, waarbij het model een perfecte score van 100% behaalde, een aanzienlijke verbetering ten opzichte van de 78,5% van de voorganger GPT-5.6 Sol. Op ExploitGym, een breder benchmark voor exploitontwikkeling, behaalde Astra een succespercentage van 42,4%, tegenover 30,3% voor Sol, terwijl het minder outputtokens gebruikte. Volgens OpenAI kan Astra’s vermogen om zero-day exploits te identificeren en te ontwikkelen helpen bij het opsporen en verhelpen van kwetsbaarheden, maar vereist dit ook strengere beveiligingsmaatregelen.
Daarnaast testte OpenAI Astra op kwetsbaarheden die in de drie maanden voorafgaand aan de lancering openbaar werden gemaakt, om te beoordelen of het model zelf nieuwe zwaktes kon ontdekken in plaats van alleen bekende exploits uit trainingsdata te reproduceren. Astra vond tijdens deze test twee nieuwe zero-day kwetsbaarheden, die inmiddels aan de betrokken softwareleveranciers zijn gemeld.
Volgens Sanchit Vir Gogia, chief analyst bij Greyhound Research, is de classificatie als 'kritiek' vooral een bekendmaking van de resultaten van testen, niet een verandering in de capaciteiten van het model zelf. Hij benadrukt dat Astra het enige frontier-model is waarvan de cybercapaciteiten zijn gemeten aan een gepubliceerde drempel, terwijl andere modellen die al binnen enterprise-omgevingen worden gebruikt niet op deze manier zijn beoordeeld. OpenAI gaf aan dat de publieke versie van Astra geavanceerde offensieve taken, zoals het genereren van proof-of-concept exploits, zal weigeren. Voor geverifieerde verdedigers worden deze beperkingen binnenkort versoepeld via het programma OpenAI Daybreak.
De introductie van Astra volgt op OpenAI’s uitrol van GPT-5.6 Sol en komt enkele maanden na de tijdelijke exportbeperkingen op Anthropic’s Fable en Mythos modellen vanwege vergelijkbare zorgen.
Volgens Gogia verschuift de governance van het model zelf naar de controlemechanismen eromheen. Een foutief antwoord van een chatbot is een informatieprobleem, maar een foutieve actie van een agent binnen een klantensysteem is een operationeel incident. De relevante vraag is daarom niet welk model is goedgekeurd, maar hoeveel schade een bepaalde identiteit kan aanrichten voordat een controlemechanisme ingrijpt.
Reacties
Geef een reactie
Vereiste velden zijn gemarkeerd met *