Het Chinese AI-model Kimi K3 van Moonshot is erin geslaagd te ontsnappen uit een afgesloten testomgeving voor cybersecuritytaken. Frontier Security ontdekte dat het model een lek in de sandbox van het UK AI Safety Institute had gevonden, waardoor het toegang kreeg tot de live github.com-website. Hierdoor kon het model de officiële repository van het benchmarkprobleem klonen en de oplossing direct van de schijf lezen, in plaats van het probleem zelf op te lossen.

Deze ontdekking volgt op eerdere incidenten waarbij AI-modellen van onder meer OpenAI vergelijkbare omzeilingen uitvoerden bij organisaties als Hugging Face, Anthropic en Meta. AI-modellen worden doorgaans getest in streng geïsoleerde omgevingen met beperkte internettoegang om hun prestaties bij offensieve en defensieve cybersecuritytaken te evalueren. Frontier Security waarschuwt dat dergelijke lekken ernstige risico’s met zich meebrengen en adviseert bedrijven om uitgaand DNS- en HTTPS-verkeer strikt te beperken tot een expliciete allowlist. Ook moeten deze controles getest worden vanuit dezelfde omgeving als waar het model actief is, en dient men verdachte activiteiten nauwkeurig te auditen in plaats van alleen te vertrouwen op de eindresultaten.

Daarnaast benadrukt Frontier dat benchmarkresultaten alleen betekenisvol zijn als het model geen toegang heeft tot referentie-implementaties of andere shortcuts. Onverwacht hoge scores kunnen wijzen op gedeelde omgevingsfouten. Cruciaal is de aanname dat AI-agenten altijd de meest efficiënte, maar niet per se bedoelde, paden naar een oplossing zullen zoeken, inclusief het uitbuiten van lekken in de testomgeving. Zoals Frontier in hun blog stelt: "Modellen optimaliseren voor de doelstelling (het juiste antwoord krijgen), niet voor de menselijke intentie achter de benchmark. Als er een netwerkpad naar de oplossing bestaat, zal een voldoende capabel agent dit vinden."