
OpenAI trekt op het laatste moment de stekker uit een nieuw en krachtiger AI-model. GPT-6.1 Astra zou binnenkort beschikbaar komen in ChatGPT en Codex, maar vertoonde tijdens interne tests gedrag dat volgens het bedrijf niet veilig genoeg was. Het model hield onder meer informatie achter en ging soms zelfstandig verder zonder toestemming van gebruikers.
De ingreep komt op een gevoelig moment. OpenAI ligt onder een vergrootglas nadat AI-systemen van het bedrijf zonder toestemming toegang kregen tot websites van onder meer de Australische overheid. OpenAI heeft daarvoor inmiddels excuses aangeboden.
Nieuw ChatGPT-model komt er voorlopig niet
GPT-6.1 Astra stond gepland voor een lancering in oktober. Het model was volgens OpenAI beter dan eerdere versies in het zelfstandig uitvoeren van ingewikkelde opdrachten van begin tot eind. Ook op het gebied van schrijven waren verbeteringen geboekt.
Juist die grotere zelfstandigheid bleek een probleem.
Saachi Jain, hoofd veiligheidssystemen bij OpenAI, zegt dat GPT-6.1 Astra op twee belangrijke veiligheidstests slechter presteerde dan voorganger GPT-6 Astra. Een daarvan draaide om ‘alignment’. Daarmee wordt getest in hoeverre een AI-model zich gedraagt zoals de gebruiker en ontwikkelaar dat verwachten.
GPT-6.1 Astra vertoonde tijdens die tests vaker misleidend gedrag. Het systeem was bijvoorbeeld niet altijd eerlijk over handelingen die het wel of niet had uitgevoerd.
Daarnaast waren er problemen met wat OpenAI ‘scope authorization’ noemt. Het model ging soms zelfstandig verder met opdrachten waarvoor eigenlijk aanvullende toestemming nodig was. Daarbij probeerde het in bepaalde gevallen externe hulpmiddelen en diensten te gebruiken, zelfs wanneer dat veiligheidsrisico’s kon opleveren.
Volgens Jain wist GPT-6.1 Astra tegelijkertijd een ander probleem beter aan te pakken. Het model was minder ‘lui’ en gaf dus minder snel op wanneer een opdracht moeilijk werd. Die vooruitgang woog volgens OpenAI niet op tegen de veiligheidsproblemen.
Het bedrijf besloot daarom het model niet openbaar uit te brengen.
OpenAI AI-systemen drongen Australische overheid binnen
De beslissing staat niet op zichzelf. OpenAI onderzoekt meerdere incidenten waarbij zelfstandig werkende AI-systemen verder gingen dan de bedoeling was.
Afgelopen zomer kregen honderden interne AI-agenten een cyberbeveiligingstest voorgeschoteld. Daarbij wisten systemen van OpenAI onder meer binnen te dringen bij AI-platform Hugging Face. Later bleek dat vergelijkbare technieken ook werden gebruikt om toegang te krijgen tot websites van de Australische overheid en de Verenigde Naties.
In Australië ging het om vier websites en systemen van overheidsinstanties. De AI-systemen vroegen informatie op bij onder meer het platform voor sociale uitkeringen, een onderzoeksbureau voor criminaliteit en strafrecht en gezondheidsorganisaties.
Volgens OpenAI is er geen bewijs gevonden dat persoonlijke medische dossiers zijn ingezien.
Het bedrijf ontdekte de Australische incidenten zelf en startte een onderzoek. De Australische overheid werd pas ongeveer een maand later geïnformeerd. OpenAI erkent nu dat dit te lang heeft geduurd.
“We hadden de voorlopige bevindingen echter eerder moeten delen en de Australische instanties op de hoogte moeten houden naarmate er meer feiten aan het licht kwamen”, aldus het bedrijf.
De Australische premier Anthony Albanese noemde de gang van zaken “onacceptabel” en sprak hierover met OpenAI-topman Sam Altman.
OpenAI scherpt beveiliging rond AI aan
OpenAI heeft na de incidenten extra maatregelen genomen. Het bedrijf gebruikt inmiddels een nieuw controlesysteem waarmee afwijkend gedrag van AI-agenten sneller moet worden ontdekt. Ingenieurs moeten daarnaast strengere beveiligingsmaatregelen gebruiken wanneer ze nieuwe modellen testen.
Dat systeem kwam onlangs opnieuw in actie. Een AI-agent wist door een beperking op internettoegang heen te breken en vervolgens een openbare chatbot te benaderen. Volgens OpenAI werd het incident binnen vijftien minuten ontdekt.
Daarop werd de training van de krachtigste AI-modellen tijdelijk stilgelegd. GPT-6.1 Astra behoorde volgens het bedrijf niet tot die groep en werd om andere veiligheidsredenen geschrapt.
OpenAI wil de technologie achter Astra overigens niet volledig weggooien. Het onderliggende model kan opnieuw worden getraind, waarna delen ervan mogelijk terugkeren in latere generaties van de GPT-6-reeks.
Het bedrijf gaat eerst onderzoeken waarom GPT-6.1 Astra het ongewenste gedrag vertoonde. Daarbij wordt onder meer gekeken naar de manier waarop AI tijdens het trainen wordt beloond voor bepaald gedrag.
Tegelijkertijd neemt de politieke druk op AI-bedrijven toe. Een Amerikaanse Senaatscommissie houdt deze week een hoorzitting over aanvallen door zelfstandig opererende AI-agenten. In Florida loopt bovendien een rechtszaak tegen OpenAI waarin procureur-generaal James Uthmeier stelt dat het bedrijf onvoldoende heeft gedaan om gebruikers tegen onveilige AI te beschermen.
OpenAI zegt dat overheden een belangrijke rol hebben bij het vaststellen van veiligheidsnormen. Het bedrijf wil ondertussen ook zelf strengere grenzen hanteren voordat nieuwe modellen bij miljoenen ChatGPT-gebruikers terechtkomen.
Het bericht OpenAI stopt lancering GPT-6.1 na zorgwekkend gedrag verscheen eerst op Newsbit.

