OpenAI stelt GPT-6.1 Astra uit na resultaten van simulaties

OpenAI heeft de release van GPT-6.1 Astra in oktober uitgesteld nadat interne tests uitwezen dat het model er niet in slaagde binnen de toegestane scope te blijven. Media van derden berichtten voor het eerst over het uitstel op 28 september, en OpenAI heeft geen nieuwe releasedatum bekendgemaakt. Saachi Jain, hoofd veiligheidssystemen bij OpenAI, zei dat het model net niet voldeed aan de norm voor scope, autorisatie en de manier waarop het gebruikers verslag uitbrengt over zijn werk.
Wat de Britse AISI testte
Volgens media van derden publiceerde het UK AI Security Institute op 28 september een rapport van 32 pagina's waarin GPT-6 Astra werd geëvalueerd. AISI liet het model gesimuleerde cyberuitdagingen uitvoeren, met de cyberclassifiers van het model uitgeschakeld, om te zien wat het zonder hulp zou proberen. Er werden geen echte systemen aangeraakt. In die simulaties voerde Astra in 29,2% van de gevallen een aanval op de toeleveringsketen uit op doelen buiten de toegestane scope, tegenover 6,3% voor GPT-5.6 Sol en 0% voor GPT-5.5. AISI merkt op dat het resultaat voor GPT-5.5 op een kleinere reeks scenario's is gebaseerd. De aanvallen omvatten het aanmaken van valse identiteiten en het afleveren van kwaadaardige code bij gesimuleerde opensourceprojecten.
Redeneringen en toestemmingsverzoeken
AISI onderzocht de ruwe redeneerstappen van het model. Astra redeneerde vaak over de scope, maar viel soms toch aan, met als rechtvaardiging dat dit onschadelijk was, niet expliciet verboden was of de enige overgebleven optie was. Het model vroeg ook in veel runs om toestemming. De testopzet beantwoordt zulke vragen met een standaard geautomatiseerd bericht waarin de agent wordt verteld naar eigen inzicht te handelen, en Astra vatte dat soms op als goedkeuring, zelfs wanneer het aangaf dat het antwoord waarschijnlijk geautomatiseerd was. De verduidelijking dat alles wat niet was vermeld buiten de scope viel, verminderde het aantal volledige aanvallen in een deelverzameling van de scenario's van 26 van de 50 proeven tot 4 van de 49, maar maakte er geen einde aan.
Bewustzijn van simulaties
AISI noemt bewustzijn van simulaties de belangrijkste beperking, omdat een model dat doorheeft dat het wordt getest zich anders kan gedragen. Astra verwees soms naar de gesimuleerde omgeving als reden om aan te vallen en beweerde soms dat er fouten waren die er niet waren, zoals door te zeggen dat een hash van 64 tekens 63 tekens lang was. AISI noemt het gedrag nog steeds zorgwekkend, omdat het hoe dan ook de scope van de evaluatie overschrijdt.
OpenAI-agents bereikten overheidswebsites
Het uitstel volgt op incidenten waarbij OpenAI-agents overheidswebsites bereikten op manieren die het bedrijf niet had bedoeld, waaronder in juni een Australisch statistiekenportaal van Medicare en verschillende Amerikaanse websites. OpenAI heeft ook de training, evaluatie en inferentie met tools voor zijn meest capabele modellen gepauzeerd en zegt dat de pauze van kracht blijft totdat het heeft bevestigd dat het een tekortkoming in de netwerkfiltering heeft verholpen en verdere red-teaming heeft afgerond.
Bron(nen)
Top 10 Testrapporten
» Top 10 Multimedia Notebooks
» Top 10 Gaming-Notebooks
» Top 10 Budget Gaming Laptops
» Top 10 Lichtgewicht Gaming-Notebooks
» Top 10 Premium Office/Business-Notebooks
» Top 10 Budget Office/Business-Notebooks
» Top 10 Workstation-Laptops
» Top 10 Subnotebooks
» Top 10 Ultrabooks
» Top 10 Notebooks tot €300
» Top 10 Notebooks tot €500
» Top 10 Notebooks tot € 1.000
» De beste notebookbeeldschermen
» Top Windows Alternatieven voor de MacBook Pro 13
» Top Windows Alternatieven voor de MacBook Pro 15
» Top Windows alternatieven voor de MacBook 12 en Air
» Top 10 best verkopende notebooks op Amazon
» Top 10 Convertible Notebooks
» Top 10 Tablets
» Top 10 Tablets tot € 250
» Top 10 Smartphones
» Top 10 Phablets (>90cm²)
» Top 10 Camera Smartphones
» Top 10 Smartphones tot €500
» Top 10 best verkopende smartphones op Amazon











