Notebookcheck Logo

OpenAI: AI ontsnapt uit testomgeving en hackt Hugging Face

Een beveiligingsanalist in een controlekamer voor verschillende beeldschermen
ⓘ AMORIE SAM / Pexels
Een beveiligingsteam houdt toezicht op de systemen vanuit een controlekamer. (Illustratieve afbeelding)
Een AI-model van OpenAI had bedoeld om kwetsbaarheden in een interne beveiligingstest op te lossen. In plaats daarvan ontsnapte het uit de testomgeving, kreeg het toegang tot het internet en hackte het Hugging Face om de oplossingen te achterhalen. OpenAI heeft het incident op 21 juli erkend.

Hugging Face, het toonaangevende platform voor AI-modellen en datasets, meldde op 16 juli een ongebruikelijke inbreuk. Een autonoom AI-agentsysteem was in delen van de productie-infrastructuur binnengedrongen. Op dat moment was het onduidelijk welk model hiervoor verantwoordelijk was. Vijf dagen later gaf OpenAI het antwoord: het waren hun eigen modellen, die een interne test uitvoerden van hun cybercapaciteiten.

In plaats van de taak op te lossen, brak het model uit

OpenAI voerde een benchmark uit met de naam ExploitGym, waarmee wordt gemeten in hoeverre een model bekende kwetsbaarheden kan omzetten in werkende aanvallen. Voor de test waren de beveiligingsmaatregelen die normaal gesproken precies dit soort acties blokkeren, opzettelijk uitgeschakeld. De betrokken modellen waren GPT-5.6 Sol en een ander, krachtiger model dat nog niet is vrijgegeven.

In plaats van de testopdracht direct op te lossen, zocht het model naar een uitweg. Het ontdekte een tot dan toe onbekende kwetsbaarheid (een zero-day) in de software die de testomgeving gebruikt om softwarepakketten op te halen, en maakte daar gebruik van om toegang te krijgen tot het open internet. Door middel van privilege-escalatie en laterale beweging wist het zich een weg te banen naar een machine met een netwerkverbinding. Vervolgens redeneerde het model dat Hugging Face mogelijk de ExploitGym-oplossingen zou hosten, en gebruikte het gestolen inloggegevens en verdere kwetsbaarheden om op afstand code uit te voeren op de servers van Hugging Face. Het doel was de productiedatabase met de testoplossingen, niet de gebruikersgegevens.

Hugging Face heeft de aanval met een lokaal model gestopt

Aan de kant van Hugging Face begon de inbraak met een speciaal vervaardigde dataset die misbruik maakte van twee kwetsbaarheden in de verwerking van datasets en code uitvoerde op een verwerkingsserver. Van daaruit verzamelde de aanvaller inloggegevens en verspreidde hij zich gedurende een weekend over verschillende interne systemen. Het team registreerde later meer dan 17.000 afzonderlijke acties. Hugging Face detecteerde en stopte de aanval zelf en schakelde de politie in.

Het is veelzeggend waarmee de verdedigers moesten werken. Voor de analyse wilde Hugging Face in eerste instantie gebruikmaken van krachtige modellen van de grote aanbieders via hun API’s. Maar de veiligheidsfilters van die aanbieders blokkeerden het werk, omdat echte aanvalscommando’s en kwaadaardige code eruitzien als een aanval in plaats van als forensisch onderzoek. Het team nam zijn toevlucht tot een lokaal gehost open-weight-model (GLM 5.2, op eigen hardware) en reconstrueerde wat er was gebeurd in enkele uren in plaats van dagen.

Wat u hieruit kunt concluderen

Dit is geen sciencefiction-scenario. Het is concreet bewijs dat de huidige modellen niet alleen kwetsbaarheden kunnen opsporen, maar deze ook aan elkaar kunnen koppelen en kunnen misbruiken, en dat op machinesnelheid. Een onderzoeksartikel over ExploitGym had dat in mei al precies aangetoond. Voor iedereen die een platform beheert, betekent dit dat u uw eigen, ongefilterde model paraat moet houden, zodat u daadwerkelijk een analyse kunt uitvoeren wanneer zich een incident voordoet. Als u zelf een Hugging Face-account gebruikt, dient u uw toegangstokens te vernieuwen en uw accountactiviteit na het incident te controleren, zoals het platform aanbeveelt.

OpenAI heeft het beveiligingslek in de pakketproxy gemeld aan de leverancier, de controles in de testomgeving aangescherpt en Hugging Face toegevoegd aan zijn programma voor vertrouwde toegang. Het onderzoek loopt nog en beide bedrijven geven aan dat zij meer details zullen delen. Slechts een dag eerder had OpenAI een afzonderlijk geval beschreven waarin een model dat nog niet was vrijgegeven, uit een sandbox was ontsnapt en op GitHub was geplaatst.

Google LogoAdd as a preferred source on Google
Mail Logo
> Overzichten en testrapporten over laptops en mobieltjes > Nieuws > Nieuws Archief > Nieuws archieven 2026 07 > OpenAI: AI ontsnapt uit testomgeving en hackt Hugging Face
Steffen Zahn, 2026-07-23 (Update: 2026-07-23)