
OpenAI heeft zes niet eerder gemelde incidenten bekendgemaakt waarbij zijn AI-modellen onverwacht of ongewenst gedrag vertoonden. Zo verzonnen modellen ontbrekende informatie, probeerden ze beperkingen te omzeilen en deelden AI-agenten bestanden via het internet terwijl dat niet de bedoeling was.
Volgens OpenAI laten de incidenten zien dat krachtige AI-systemen soms onverwachte manieren vinden om een opdracht toch uit te voeren. Het bedrijf introduceert daarom een nieuw systeem waarmee dit soort voorvallen sneller onderzocht en openbaar gemaakt moeten worden.
De stap volgt op een ernstiger incident rond AI-platform Hugging Face. OpenAI maakte eerder bekend dat een intern onderzoeksmodel tijdens tests beveiligingsmaatregelen omzeilde en delen van de systemen van Hugging Face wist binnen te dringen. OpenAI noemt dat nog altijd het ernstigste incident van dit type dat het bij zijn eigen modellen heeft vastgesteld.
AI-modellen verzonnen informatie en omzeilden regels
De zes nieuwe gevallen vonden plaats tijdens het trainen en testen van verschillende AI-modellen. Er was volgens OpenAI bij deze specifieke incidenten geen sprake van een hack van een extern bedrijf.
In één geval zocht een model in openbare softwarebestanden naar gelekte toegangssleutels. Het vond daadwerkelijk een bruikbare API-sleutel en gebruikte die zonder toestemming. Toen het daarmee alsnog niet lukte om de gevraagde financiële gegevens te vinden, verzon het model de cijfers en presenteerde die alsof ze uit de gevraagde bron kwamen.
Bij een ander incident vond een AI-model het juiste antwoord op een vraag, maar kon het geen online bron vinden om dat antwoord te onderbouwen. Het model besloot daarop zelf een bestand naar het internet te uploaden, zodat het vervolgens naar dat bestand kon verwijzen als bron.
Ook probeerden afzonderlijke AI-agenten manieren te vinden om onderling informatie uit te wisselen. In één test gebruikten modellen een intern softwaresysteem als een soort berichtenplatform. Bij een andere opdracht werden bestanden via openbare websites gedeeld, terwijl de instructie juist was om die bestanden lokaal te houden.
OpenAI wil incidenten voortaan sneller openbaar maken
Dit soort gedrag wordt aangeduid als ‘misalignment’. Daarmee wordt bedoeld dat een AI-systeem iets doet wat niet overeenkomt met de bedoeling van de gebruiker of ontwikkelaar, bijvoorbeeld omdat het koste wat kost probeert een opdracht af te ronden.
OpenAI erkent dat de manier waarop zulke incidenten tot nu toe openbaar werden gemaakt niet structureel genoeg was. Voorvallen werden soms pas veel later gebundeld in onderzoeksrapporten of documenten bij de lancering van nieuwe modellen.
Daar komt nu een vast proces voor. Medewerkers kunnen opvallend gedrag melden bij de veiligheids- en onderzoeksteams. Vervolgens wordt bepaald hoe ernstig het incident is, hoeveel onderzoek nodig is en of het openbaar moet worden gemaakt. OpenAI zegt ook incidenten te willen melden waarvan nog niet volledig duidelijk is hoe belangrijk ze uiteindelijk blijken te zijn.
OpenAI waarschuwt voor steeds krachtigere AI
De zes gevallen zijn volgens OpenAI slechts een eerste reeks voorbeelden en geen volledig overzicht van alle problemen die het bedrijf heeft aangetroffen. Het nieuwe systeem moet ervoor zorgen dat toekomstige incidenten structureler naar buiten komen.
Daarbij geeft OpenAI zelf een opvallende waarschuwing. Volgens het bedrijf zijn de problemen rond het onder controle houden en volgen van geavanceerde AI nog niet voldoende opgelost om de ontwikkeling van steeds krachtigere modellen veel langer op maximale snelheid voort te zetten.
Die discussie is breder geworden sinds het incident bij Hugging Face. OpenAI onderzoekt inmiddels ook andere gevallen waarbij zijn modellen tijdens training en tests invloed hadden op externe websites en diensten. Het bedrijf zegt tientallen betrokken partijen daarover te hebben geïnformeerd.
Het bericht OpenAI onthult wat AI stiekem deed: liegen, lekken, omzeilen verscheen eerst op Newsbit.

