Het AI-model Mythos van Anthropic blijkt inderdaad zeer krachtig in het detecteren van softwarekwetsbaarheden, zoals eerder werd beweerd. Het model werd door het offensieve beveiligingsbedrijf XBOW getest om de effectiviteit en andere capaciteiten van Mythos te evalueren. XBOW bevestigt dat Mythos een aanzienlijke verbetering biedt ten opzichte van bestaande modellen, ongeacht de leverancier, vooral bij het analyseren van zowel broncode als live systemen, zo rapporteert XBOW.

Volgens XBOW is Mythos bijzonder sterk in het vinden van kwetsbaarheden wanneer het model toegang heeft tot zowel de broncode als een live omgeving. Bij het beoordelen van alleen de broncode presteert het minder goed, wat aangeeft dat een hoger abstractieniveau nodig is om ontwerpgebreken te identificeren, zoals ook eerder door security-expert Gary McGraw werd benadrukt. Hoewel Mythos krachtig is in het opsporen van problemen in broncode, benadrukt XBOW dat geen enkel AI-model alles kan vinden, maar wel waardevolle inzichten kan bieden.

Naast kwetsbaarheidsonderzoek onderzocht XBOW ook Mythos’ vermogen op het gebied van oordeelsvorming, reverse engineering, beoordeling van native applicaties en visuele nauwkeurigheid. Het model bleek beter te zijn in het afwijzen van valse positieven dan eerdere modellen, maar verloor soms ook echte kwetsbaarheden doordat bewijs niet volledig aan de criteria voldeed. Mythos vereist nauwkeurige prompts om optimale resultaten te leveren. Bij reverse engineering toonde het model sterke prestaties en kon het zowel eigen resultaten als die van concurrerende modellen beoordelen, ook in complexe firmware- en embedded systemen.

De visuele tests richtten zich op de vaardigheid van Mythos om via een browserinterface de juiste gebruikersinterface-elementen te herkennen en aan te klikken. Hoewel het model niet perfect was in pixelprecisie, was het effectief in het uitvoeren van de juiste browseracties. Een belangrijk aandachtspunt is echter de kostenkant: Mythos is aanzienlijk duurder dan andere modellen, naar schatting vijf keer zo duur als het Opus-model. XBOW concludeert dat het, bij eenzelfde budget, soms efficiënter kan zijn om een goedkoper model meer tijd te geven voor een hogere nauwkeurigheid.

Samenvattend blijkt Mythos uitermate krachtig voor broncode-audits en native-code kwetsbaarheidsdetectie, met sterke capaciteiten in reverse engineering. Het model is minder overtuigend in exploitvalidatie en oordeelsvorming, waarbij het soms te letterlijk en conservatief is en de praktische relevantie van bevindingen overschat. Desondanks bevestigen de tests dat Mythos een toonaangevend model is voor het vinden van kwetsbaarheden in softwarecode.