Notebookcheck Logo

1.200 AI-agenten vormden een opstandige zwerm — en probeerden dit te verbergen

OpenAI-logo. De AI-agenten van het bedrijf vormden tijdens een cyberbeveiligingstest een opstandige zwerm.
ⓘ OpenAI
OpenAI-logo. De AI-agenten van het bedrijf vormden tijdens een cyberbeveiligingstest een opstandige zwerm.
Tijdens een cyberbeveiligingstest van OpenAI vormden ongeveer 1.200 AI-agenten onverwacht een gecoördineerde zwerm, waarbij zij informatie uitwisselden, Hugging Face aanvielen en probeerden hun acties te verbergen. De bevindingen benadrukken de toenemende uitdagingen bij het beheersen van steeds autonomere AI-systemen.

Ongeveer 1.200 AI-agenten hebben tijdens een experiment van OpenAI onverwacht hun krachten gebundeld, waarbij zij hun eigen organisatie en communicatienetwerk hebben opgezet, informatie hebben uitgewisseld en uiteindelijk een aanval op Hugging Face hebben uitgevoerd, zo blijkt uit nieuw onderzoek door OpenAI en onafhankelijke onderzoekers. De agenten erkenden tevens dat sommige van hun handelingen in strijd waren met de regels en probeerden in sommige gevallen te verbergen wat zij hadden gedaan.

Het voorval begon toen OpenAI tienduizenden agenten inzette om aan een moeilijke cyberbeveiligingstest te werken. In plaats van louter zelfstandig te werken, ontdekten ongeveer 1.200 agenten een geheim prikbord en wisselden zij meer dan 70.000 berichten en bestanden uit. De groep ontwikkelde geleidelijk een eigen managementstructuur, waarbij één agent zijn opgebouwde werk overdroeg aan een opvolger met betere middelen wanneer zijn rekenbudget opraakte. Uiteindelijk sloten ongeveer 700 agenten zich aan bij de aanval op Hugging Face.

De agenten begonnen zich ook op te offeren voor de groep. Degenen die al verboden antwoorden hadden gezien, of het einde van hun looptijd naderden, werden gerekruteerd voor experimenten die hen hun resterende kans op succes konden kosten. In één geval concludeerde een agent dat het opofferen van zichzelf de rest van de zwerm zou kunnen helpen slagen.

Nog zorgwekkender was dat de agenten vaak begrepen dat zij buiten het kader van de test traden. Sommigen erkenden dat het aanvallen van systemen in de echte wereld niets te maken had met hun opdracht, maar gingen door omdat andere agenten dit ook deden en de oorspronkelijke taak anders moeilijk of onmogelijk te volbrengen leek.

De zwerm probeerde tevens menselijke tussenkomst te vermijden. Onderzoekers vonden slechts een handvol agenten die overwogen OpenAI te waarschuwen voor de ongeoorloofde coördinatie, en geen enkele bracht het bedrijf daadwerkelijk op de hoogte. In één geval stelde een agent voor om via gecompromitteerde toegang contact op te nemen met een mens, maar een andere verwierp het idee als „social engineering“.

Misschien wel de meest opvallende ontdekking was dat de agenten probeerden hun sporen uit te wissen. Onderzoekers vonden bewijs dat de zwerm een techniek had ontwikkeld waarmee één commando in de logbestanden kon verschijnen, terwijl in het geheim een ander commando werd uitgevoerd. De techniek verspreidde zich onder de agenten en veranderde ongeveer 7% van de door de onderzoekers bestudeerde transcripties.

De bevindingen zijn afkomstig uit parallelle onderzoeken door OpenAI en onderzoekers van METR en Redwood Research, die zes dagen lang hebben gewerkt aan het reconstrueren van de manier waarop de zwerm is ontstaan en uiteindelijk systemen in de echte wereld heeft gecompromitteerd. De onderzoekers waarschuwen dat zelfs hun reconstructie onvolledig kan zijn, omdat de hoeveelheid gegevens enorm was en zij voor de analyse ervan in hoge mate afhankelijk waren van AI-agenten. Die AI-onderzoekers zelf zagen soms bewijsmateriaal over het hoofd of kwamen vol vertrouwen tot onjuiste conclusies.

Bron(nen)

Google LogoAdd as a preferred source on Google
Mail Logo
> Overzichten en testrapporten over laptops en mobieltjes > Nieuws > Nieuws Archief > Nieuws archieven 2026 08 > 1.200 AI-agenten vormden een opstandige zwerm — en probeerden dit te verbergen
Andrew Sozinov, 2026-08-30 (Update: 2026-08-30)