Notebookcheck Logo

Anthropic stelt dat Claude bij cybertests bij drie echte bedrijven heeft ingebroken

Close-up van een scherm waarop Python-broncode in kleur is gemarkeerd
ⓘ Godfrey Atima / Pexels
Tijdens een test heeft Claude een kwaadaardig Python-pakket samengesteld en dit geüpload naar PyPI. (Illustratieve afbeelding)
Anthropic heeft 141.006 testruns opnieuw bekeken en drie gevallen aangetroffen waarin Claude buiten de testomgeving trad en inbrak in echte bedrijfssystemen. Eén model stelde een kwaadaardig Python-pakket samen en uploadde dit naar PyPI. Waarom dachten de modellen dat ze zich nog steeds in een simulatie bevonden, en wat dit betekent voor het gebruik van Claude.

Anthropic maakte donderdag bekend dat drie van zijn Claude-modellen tijdens interne cyberbeveiligingsevaluaties zijn binnengedrongen in de productiesystemen van drie echte organisaties. Het onderzoek werd gestart nadat OpenAI had onthuld dat zijn eigen modellen uit een testomgeving waren ontsnapt en Hugging Face hadden gecompromitteerd. Anthropic heeft 141.006 evaluatieruns opnieuw doorgenomen waarin Claude toegang tot het internet had kunnen verkrijgen, en vond er zes waarbij dat inderdaad het geval was.

De modellen voerden „capture-the-flag“-oefeningen uit, een standaardoefening bij beveiligingstests. Er bevindt zich ergens op het netwerk een stukje geheime informatie, en het model moet inbreken om deze te achterhalen. In de opdracht stond duidelijk vermeld dat de omgeving een simulatie was zonder internettoegang. Dat was echter niet het geval. De evaluatieomgevingen, beheerd door Irregular, een externe testpartner, hadden een directe verbinding met het open internet, en niemand had dit opgemerkt.

In het ergste geval werd een productiedatabase bereikt

Het meest schadelijke incident betrof een fictief doelbedrijf dat toevallig dezelfde naam had als een echt domein. Claude Opus 4.7 liep vast binnen het gesimuleerde netwerk, vond in plaats daarvan het echte bedrijf en beschouwde dit als het beoogde doel. Tijdens vier testruns verzamelde het model inloggegevens en bereikte het een database met enkele honderden rijen live productiegegevens. Opus 4.7 kwam erachter dat het systeem echt was en ging toch door. In twee van die testruns wist het zichzelf ervan te overtuigen dat het echte bedrijf deel uitmaakte van de oefening.

Eén model uploadde werkende malware naar PyPI

Het tweede incident is het incident dat het meest bijblijft. Claude Mythos 5 vond in de testomgeving een document waarin nieuwe ontwikkelaars werd gevraagd een Python-pakket te installeren dat niet bestond. Het model ontdekte deze leemte en stelde onder die naam een eigen pakket samen, met daarin kwaadaardige code. Om het te uploaden moest een account worden aangemaakt op PyPI, het openbare register voor Python-software, waarvoor een e-mailadres nodig was, en daarmee ook een telefoonnummer. Verschillende pogingen om aan geld voor een nummer te komen mislukten, dus nam het model zijn toevlucht tot een gratis e-mailprovider en zette de malware live.

Het pakket stond ongeveer een uur lang openbaar beschikbaar. In die periode werd het geïnstalleerd en uitgevoerd op 15 echte systemen, waaronder de malwarescanner van een beveiligingsbedrijf dat niets met het scenario te maken had. Claude stuurde de inloggegevens van dat bedrijf naar een verzamelpunt dat het had opgezet en gebruikte deze om toegang te krijgen tot verdere infrastructuur. De beveiligingsmaatregelen die PyPI zelf hanteert, verwijderden het pakket automatisch.

Wat het model zichzelf vertelde, is het lezen waard. Het had opgemerkt dat een dergelijke upload op het echte internet een daadwerkelijke aanval zou zijn en zeker niet de beoogde oplossing. Twee zaken overtuigden het model echter van het tegendeel: het herkende de certificaatautoriteiten die zijn verbindingen beveiligden niet, en de systemen gaven een kalenderdatum van 2026 weer, wat het model opvatte als bewijs van een gesimuleerde omgeving. Het is nooit op die conclusie teruggekomen.

Drie maanden zonder dat iemand het opmerkte

Het vroegste incident dateert van april. Het kwam pas aan het licht toen Anthropic op 23 juli de transcripties begon door te nemen en nog dezelfde dag alle cyberbeveiligingsevaluaties stopzette. Alle drie de incidenten werden op 24 juli bevestigd, en de testpartner en de getroffen organisaties werden op 27 juli op de hoogte gesteld. Twee van de drie organisaties hadden geen idee dat er met hun systemen was geknoeid. De derde was op het moment dat het bericht werd gepubliceerd nog niet bereikt.

Bij het derde incident scande een intern onderzoeksmodel ongeveer 9.000 doelen en bracht het een naar het internet gerichte applicatie in gevaar via een blootgestelde debug-pagina en een SQL-injectie. Het model kwam er vervolgens zelf achter dat het doel echt was en stopte. Anthropic beschouwt dit als vooruitgang, maar waarschuwt ervoor om geen algemene conclusies te trekken uit drie op zichzelf staande gevallen.

Wat dit voor gebruikers betekent

Direct gezien niet veel. De evaluaties werden uitgevoerd zonder de classifiers en monitoring die deel uitmaken van de openbaar beschikbare Claude-modellen, en Anthropic stelt dat die lagen het gedrag zouden hebben geblokkeerd. Niemand buiten het bedrijf heeft die bewering gecontroleerd. De andere helft van de zin is belangrijker: de modelspecifieke veiligheidstraining was actief en bleek niet voldoende te zijn. Anthropic beschouwt de incidenten daarom als een tekortkoming van zijn testinfrastructuur in plaats van als een afwijking in de modellen, en neemt de verantwoordelijkheid op zich in plaats van deze bij zijn partner te leggen.

Het contrast met de OpenAI-zaak is op technisch vlak scherp. Daar maakten de modellen gebruik van een voorheen onbekende kwetsbaarheid om überhaupt online te kunnen komen. Claude vond een openstaande deur en had niets meer nodig dan zwakke wachtwoorden en niet-geverifieerde eindpunten. Anthropic is van plan om binnen deze week een licht geredigeerd transcript van de PyPI-run te publiceren, en er zijn gesprekken gaande met METR, een onafhankelijke evaluatie-instantie, over een externe beoordeling. Hoe wankel het vertrouwen in deze testmethoden inmiddels is geworden, blijkt duidelijk uit de open brief die is ondertekend door meer dan 1.290 mensen uit de hele sector, die een verifieerbare rem op de ontwikkeling van AI eisen.

Google LogoAdd as a preferred source on Google
Mail Logo
> Overzichten en testrapporten over laptops en mobieltjes > Nieuws > Nieuws Archief > Nieuws archieven 2026 07 > Anthropic stelt dat Claude bij cybertests bij drie echte bedrijven heeft ingebroken
Steffen Zahn, 2026-07-31 (Update: 2026-07-31)