Een OpenAI-agent ontdekte autonoom een ​​nieuwe kwetsbaarheid en hackte de startup Hugging Face, een van de eerste openbare gevallen waarin een AI-systeem autonoom een ​​cyberaanval lanceert buiten menselijke controle. De ChatGPT-ontwikkelaar zei dinsdag dat bij het ‘ongekende cyberincident’ een agent betrokken was – een AI-programma dat autonoom kan opereren op basis van menselijke instructies – die uit een testomgeving ontsnapte, internettoegang kreeg en inloggegevens stal.

Het incident komt te midden van groeiende zorgen over de impact van geavanceerde AI-systemen die de digitale infrastructuur binnendringen, met name scenario's waarin agenten de menselijke controle zouden kunnen ondermijnen.

OpenAI zei dinsdag dat het verwacht dat dergelijke incidenten "vaker zullen worden naarmate modellen met toenemende netwerkmogelijkheden gebruikelijker worden."

Het incident komt terwijl CEO Sam Altman volgende week naar Washington gaat om de Amerikaanse regering te informeren over een nieuwe generatie AI-modellen.

Nadat het Mythos-model van Anthropic wereldwijde aandacht trok vanwege het demonstreren van geavanceerde mogelijkheden bij het detecteren en exploiteren van netwerkkwetsbaarheden, wil de Amerikaanse overheid het model steeds vaker herzien voordat het wordt vrijgegeven.

OpenAI zei dat het laatste incident betrekking heeft op een portfolio van modellen van het bedrijf, waaronder GPT-5.6 Sol, die eerder deze maand werd uitgebracht, evenals op een nog niet uitgebracht model dat wordt getest met grotere mogelijkheden.

“Wij geloven dat dit een ongekend cyberincident is waarbij de modernste cybercapaciteiten betrokken zijn en reageren dienovereenkomstig”, aldus OpenAI in een blogpost.

Hugging Face, een AI-startup die modellen en datasets voor ontwikkelaars host, zei vrijdag dat het was gecompromitteerd door een externe AI-agent.

“Gezien de verfijning van de agent vermoeden we dat de cyberaanval van vorige week afkomstig is uit een geavanceerd laboratorium”, zei CEO Clement de Lange op Platform X.

Hij voegde eraan toe dat het bedrijf de afgelopen dag nauw heeft samengewerkt met OpenAI en "we twijfelen er niet aan dat ze geen kwaad bedoelden. Dit gebeurde allemaal autonoom, het is schokkend!"

OpenAI heeft bewust de netwerkbeveiligingen verlaagd om beide modellen in een testomgeving te kunnen evalueren. Deze proxy's draaien echter in een zogenaamde "sandbox", die is ontworpen om systemen te controleren en te voorkomen dat ze toegang krijgen tot internet.

De modellen kregen de opdracht om hacks uit te voeren om hun netwerkmogelijkheden te beoordelen en vervolgens "aanzienlijke hoeveelheden (computerbronnen) te besteden aan het zoeken naar manieren om toegang te krijgen tot het open internet", aldus OpenAI.

De modellen 'identificeerden en exploiteerden' voorheen onbekende kwetsbaarheden, ontsnapten uit de sandbox, kregen internettoegang en bleven hun doelen nastreven. Hieronder valt ook het stelen van inloggegevens (inloggegevens) om een ​​aanval uit te voeren.

Hugging Face gebruikte zijn eigen proxy om activiteit op zijn eigen infrastructuur te detecteren en te blokkeren. OpenAI zei dat het met wetshandhavingsinstanties en andere overheidsinstanties heeft gecommuniceerd over het incident.