Microsoft heeft een nieuw AI-model geïntroduceerd binnen MDASH, het multi-model platform voor het identificeren en verhelpen van kwetsbaarheden. Het model, MAI-Cyber-1-Flash, behaalde een score van 95,95% op de CyberGym Level 1 test, een benchmark voor het reproduceren van bekende kwetsbaarheden. Dit resultaat werd behaald in combinatie met GPT-5.4 en zou volgens Microsoft ongeveer de helft van de kosten van de huidige beste MDASH-configuratie besparen.
MAI-Cyber-1-Flash is specifiek ontwikkeld voor cybersecurity en vervangt ongeveer 80% van de bestaande modellen binnen MDASH. Het model is ontworpen om tot 90% van de taken binnen MDASH af te handelen, terwijl GPT-5.4 wordt ingezet voor de complexere 10%. Deze combinatie is alleen beschikbaar voor geselecteerde MDASH-klanten via een private preview in Azure AI Foundry en niet als een zelfstandig publiek model of algemene API.
De CyberGym Level 1 test geeft een agent een beschrijving van een kwetsbaarheid en de bijbehorende ongepatchte broncode, waarna wordt gecontroleerd of een werkend proof of concept kan worden geproduceerd. Deze test meet echter niet het blind ontdekken van kwetsbaarheden of de correctheid van gegenereerde patches. Op het moment van controle stond het nieuwe resultaat van 95,95% nog niet vermeld op de publieke leaderboard, waar de vorige score van Microsoft op 88,4% bleef staan.
Volgens de model card is MAI-Cyber-1-Flash een transformer met 137 miljard parameters, waarvan 5 miljard actief zijn, en een contextvenster van 256.000 tokens. Het model is een cybersecurity-finetuning van MAI-Code-1-Flash, dat zelf is ontwikkeld vanuit een MAI-Thinking-1 checkpoint. Microsoft benadrukt dat het systeem als geheel het product is, waarbij routing tussen modellen centraal staat: MAI-Cyber-1-Flash behandelt het merendeel van de taken en GPT-5.4 de moeilijkste resterende taken.
De kostenbesparing van 50% wordt vergeleken met de huidige beste MDASH-configuratie, die bestaat uit GPT-5.4, GPT-5.4 mini en GPT-5.3 Codex. Details over tokenverbruik, latency, taakverdeling en rekenkracht achter deze vergelijking zijn nog niet openbaar, waardoor onafhankelijke verificatie nog niet mogelijk is. Naast CyberGym zijn er ook scores gerapporteerd voor andere benchmarks zoals CVEBench en CyberSecEval4, maar deze zijn niet direct vergelijkbaar.
Reacties
Geef een reactie
Vereiste velden zijn gemarkeerd met *