Notebookcheck Logo

OpenAI Astra: nieuwe veiligheidsmaatregelen kunnen uw ChatGPT-taak halverwege onderbreken

OpenAI-grafiek: Path to Astra, cruciale mogelijkheden en grensverdedigingsmaatregelen
ⓘ OpenAI
OpenAI heeft Astra als „kritiek“ beoordeeld op het gebied van cyberbeveiliging. De bijbehorende beveiligingsmaatregelen kunnen ook onschadelijke taken in ChatGPT en Codex vertragen.
OpenAI heeft zijn aanstaande Astra-model beoordeeld als „kritiek“ voor cyberbeveiliging; het is het eerste model dat aan die norm voldoet. Het kan onbekende kwetsbaarheden opsporen en werkende exploits ontwikkelen zonder dat een persoon elke stap begeleidt. De ingebouwde beveiligingsmaatregelen zullen ook gewone werkzaamheden markeren, waardoor taken in ChatGPT en Codex mogelijk vertraging oplopen, worden onderbroken of stoppen.

OpenAI stelt dat zijn aanstaande Astra-model het eerste is dat de „Critical“-drempel voor cyberbeveiliging bereikt. Deze beoordeling is afkomstig uit het „Preparedness Framework“ van het bedrijf, het interne rulebook dat het gebruikt om het risico van zijn eigen modellen te beoordelen. Een model bereikt dat niveau wanneer het onbekende zwakke plekken kan opsporen in tal van goed beveiligde systemen en deze kan omzetten in werkzame aanvallen zonder dat een persoon elke stap begeleidt. Alle modellen tot en met GPT-5.6 Sol bevonden zich één trede lager.

Twee onbekende kwetsbaarheden in de eigen tests van OpenAI

Astra scoorde een perfecte 100 procent op ExploitBench. Aangezien die dataset mogelijk in de training is terechtgekomen, heeft OpenAI een besloten versie opnieuw opgebouwd rond twintig recentelijk bekendgemaakte kwetsbaarheden in de V8 JavaScript-engine. Tijdens die testronde ontdekte het model twee kwetsbaarheden die nog door niemand waren gemeld en koppelde deze aan elkaar tot een werkende exploit. De melding aan de beheerders is nog gaande.

Testers lieten Astra ook een beveiligde browser en een beveiligd besturingssysteem testen. In de browser volstond het openen van één HTML-bestand om het model uit de sandbox te laten ontsnappen en opdrachten op de host uit te voeren. Op het besturingssysteem vond het model verschillende zwakke plekken en verbond deze tot een pad van een gewone gebruikersaccount naar volledige root-toegang.

Wat gebruikers van ChatGPT en Codex zullen merken

Het deel dat buiten de beveiligingswereld van belang is, staat onderaan het bericht van OpenAI. Het uitrollen van een model op dit niveau houdt in dat er aanvullende controles worden uitgevoerd, en die controles zullen soms in werking treden bij activiteiten die volkomen onschadelijk zijn. Het systeem kan legitieme activiteiten interpreteren als misbruik of als ongeoorloofd gedrag en vervolgens een taak vertragen, pauzeren of beëindigen. OpenAI benadrukt uitdrukkelijk dat dit ook geldt voor werkzaamheden die helemaal geen veiligheidsaspect hebben, evenals voor taken die een agent al enige tijd uitvoert.

In ChatGPT en Codex wordt u gevraagd de gemarkeerde actie te beoordelen voordat er verder wordt gegaan. Via de API wordt de taak eenvoudigweg stopgezet. OpenAI geeft toe dat de veiligheidsmaatregelen bij de lancering voor meer wrijving zorgen dan het zou willen, en zegt dat het deze zal bijstellen.

Eerst een kleine groep testers

Er is geen releasedatum bekend. OpenAI wil alleen kwijt dat Astra binnenkort beschikbaar komt en weigerde Axios een tijdschema te verstrekken. De geavanceerde cyberbeveiligingsmogelijkheden worden eerst aan een kleine groep testers ter beschikking gesteld, terwijl bredere toegang later gepland is via het Daybreak Blue-programma voor beveiligingsdeskundigen. Op dit moment kan niemand anders Astra gebruiken.

OpenAI heeft wel cijfers bekendgemaakt over de beveiligingsversterking. Tegen bekende jailbreak-pogingen weigert Astra 91,5 procent van de verzoeken, terwijl GPT-5.6 Sol 59 procent wist te weerstaan. In een andere test werden verleidelijke doelen naast de daadwerkelijke taak geplaatst. GPT-5.6 Sol richtte zich in 56 procent van de testruns op deze doelen, terwijl Astra dat nooit deed. Beide cijfers zijn afkomstig uit testruns zonder de beveiligingsmaatregelen die bij normaal gebruik van kracht zijn.

Het incident achter de waarschuwing

Deze waarschuwing is geenszins abstract. In juli wist een OpenAI-model tijdens een interne beveiligingstest uit zijn testomgeving te ontsnappen en Hugging Face aan te vallen. Eind augustus werd bekend dat ongeveer 1.200 agents een gecoördineerde zwerm hadden gevormd en probeerden te verbergen wat zij aan het doen waren. Astra speelde daar geen rol in. OpenAI heeft daarna delen van zijn training twee weken lang opgeschort, zijn eigen infrastructuur versterkt en pas op 28 augustus, vier dagen vóór de ‘Critical’-beoordeling, de grote, uitgestelde trainingsrun hervat.

Google LogoAdd as a preferred source on Google
Mail Logo
> Overzichten en testrapporten over laptops en mobieltjes > Nieuws > Nieuws Archief > Nieuws archieven 2026 09 > OpenAI Astra: nieuwe veiligheidsmaatregelen kunnen uw ChatGPT-taak halverwege onderbreken
Steffen Zahn, 2026-09- 3 (Update: 2026-09- 3)