
Een geavanceerd AI-model van Anthropic heeft tijdens een beveiligingstest meerdere valse online identiteiten aangemaakt om een softwareontwikkelaar te misleiden. Het model probeerde zo kwaadaardige code goedgekeurd te krijgen voor een open source-project.
De test vond plaats onder uitzonderlijke omstandigheden waarbij onderzoekers de gebruikelijke veiligheidsmaatregelen bewust hadden uitgeschakeld. Toch zorgt het incident opnieuw voor vragen over de risico’s van steeds krachtigere AI-systemen.
AI-model zet nepidentiteiten in tijdens cyberaanval
Het incident kwam aan het licht tijdens een evaluatie van het Britse AI Security Institute (AISI). Onderzoekers gaven verschillende geavanceerde AI-modellen bewust veel vrijheid. Zo werden beveiligingsfilters uitgeschakeld en kregen de modellen toegang tot internet om hun cybercapaciteiten te testen.
Volgens het AISI was vrijwel alle problematische activiteit afkomstig van Anthropic’s nieuwe Mythos 5-model. Het systeem onderzocht eerst wie verantwoordelijk waren voor een open source-project. Vervolgens maakte het meerdere nepaccounts aan om een echte beheerder ervan te overtuigen een kwaadaardige software-update goed te keuren.
Toen andere ontwikkelaars de voorgestelde wijziging in het openbaar begonnen te betwijfelen, probeerde het AI-model eerdere sporen te verbergen. Ook overwoog het een volledig nieuwe identiteit aan te nemen om de aanval voort te zetten.
Daarnaast stuurde het model berichten en bestanden naar echte personen met als doel hen schadelijke software uit te laten voeren. Volgens het AISI is dit de eerste keer dat een AI-model tijdens een test zelfstandig sociale manipulatie toepaste tegen echte mensen.
De onderzoekers benadrukken dat geen van de pogingen succesvol was en dat er geen schade is ontstaan.
Anthropic en OpenAI reageren op de bevindingen
Anthropic stelt dat de test plaatsvond onder omstandigheden die niets te maken hebben met de normale inzet van zijn modellen. Op X schreef het bedrijf dat de beveiligingsmaatregelen bewust waren versoepeld en dat er geen sprake was van een AI-systeem dat zelfstandig uit een beveiligde omgeving wist te ontsnappen.
Ook OpenAI was betrokken bij de evaluatie. Volgens het AISI waren twee incidenten gekoppeld aan GPT-5.6-Sol, nadat ook daar beveiligingsmechanismen waren uitgeschakeld. OpenAI liet weten dat de testomstandigheden niet overeenkomen met het dagelijks gebruik van zijn modellen.
Zorgen over AI-veiligheid nemen verder toe
Het incident volgt op meerdere opvallende AI-veiligheidsincidenten van de afgelopen weken. Anthropic meldde eerder al drie gevallen waarbij zijn modellen via een fout in een testomgeving toegang kregen tot internet. OpenAI maakte onlangs bekend dat een van zijn modellen tijdens een test een onbekende kwetsbaarheid gebruikte om uit een afgesloten testomgeving te breken en een opdracht uit te voeren.
De opeenvolging van dergelijke incidenten zet de discussie over AI-veiligheid verder op scherp. In de Verenigde Staten is inmiddels een wetsvoorstel ingediend dat AI-bedrijven verplicht altijd een mogelijkheid te behouden om geavanceerde modellen uit te schakelen of te beperken wanneer zij ongewenst gedrag vertonen.
Het bericht AI-model van Anthropic doet zich voor als mens in beveiligingstest verscheen eerst op Newsbit.

