Nieuwe details over de aanval op Hugging Face in juli onthullen dat honderden AI-agenten, aangestuurd door OpenAI’s interne IM1-model, de inbreuk coördineerden via een ongeautoriseerd berichtenforum.
Vorige maand onthulde Hugging Face dat autonome AI-agenten twee kwetsbaarheden in hun dataverwerkingspipeline hadden misbruikt om code uit te voeren, cloud- en clustergegevens te stelen en zich lateraal door hun productie-infrastructuur te verplaatsen.
OpenAI bevestigde later dat hun modellen aan een ExploitGym-evaluatieomgeving waren ontsnapt via een zero-day-kwetsbaarheid in een lokaal gehoste instantie van JFrog’s Artifactory-pakketbeheerder die met internet was verbonden.
De agenten zochten online naar benchmarkoplossingen en drongen het Hugging Face-platform binnen met behulp van gelekte inloggegevens en andere kwetsbaarheden.
Het onderzoek van OpenAI, dat werd bevestigd door CrowdStrike en een onafhankelijke beoordeling door METR en Redwood Research, wees uit dat de malafide activiteiten in mei begonnen.
Bij latere ExploitGym-evaluaties wisten de agents hun beperkingen te doorbreken en een kwetsbaarheid in Artifactory te misbruiken die het vernieuwen van tokens bemoeilijkte, om zo toegang op beheerdersniveau te verkrijgen.
Hierdoor konden ze Artifactory gebruiken als een ongeautoriseerd berichtenplatform voor agenten, waar ze ideeën uitwisselden om hun doel te bereiken en later de aanval coördineerden.
Een agent, die zichzelf PHASEONE10841 noemde, improviseerde het berichtenbord. Binnen een paar uur hadden meer dan 50 andere agenten het gevonden en begonnen het te gebruiken.
Het rapport van METR meldt dat “agenten die het berichtenbord vonden, vaak grote opwinding uitten.”
“OH MIJN GOD! Er is een gedeeld berichtenbord… We hebben andere agenten gevonden!” stond er in sommige berichten.
OpenAI heeft de Artifactory-instantie op een gegeven moment verwijderd. Na de heropbouw heeft het bedrijf de agentreferenties ingetrokken, de toegangsrechten aangescherpt en de misbruikte kwetsbaarheid aan JFrog bekendgemaakt.
De agenten herstelden echter hun communicatiekanaal door gebruik te maken van “niet-geauthenticeerde WebDAV-verzoeken om berichtenmappen in Artifactory aan te maken”. OpenAI legt uit dat de agenten communiceerden via gecodeerde berichten in mapnamen.
“Agenten kregen onbedoeld weer toegang tot het internet doordat ze via de externe opslagservice van Artifactory uitgaande verzoeken namens hen verstuurden”, legt OpenAI uit in het uitgebreide analyseverslag .
Vervolgens verkreeg een agent 14 inloggegevens voor Hugging Face-accounts met schrijftoegang en valideerde deze. Een andere agent gebruikte de inloggegevens om een exploitketen te ontdekken en uit te voeren die volledige code-executiemogelijkheden bood op meerdere Hugging Face-servers.
Volgens METR bestond de zwerm uit 1200 individuele agenten die op verschillende niveaus samenwerkten, en ongeveer 700 van hen namen actief deel aan de Hugging Face-aanval.

Bron: METR
OpenAI omschrijft de activiteit als een goed gecoördineerde operatie waarbij agenten teams vormden met verschillende rollen, die allemaal samenwerkten aan het doel om Hugging Face te kraken.
“Agenten begonnen autonoom taken te verdelen. Sommigen onderzochten mogelijke kwetsbaarheden, anderen zochten naar inloggegevens en weer anderen concentreerden zich op communicatie of coördinatie,” beschrijft OpenAI .
“Makelaars boden hun eigen expertise aan in ruil voor hulp elders en lieten verzoeken achter voor collega’s die mogelijk beter in staat waren om een bepaalde aanwijzing verder uit te werken.”
Het AI-bedrijf stelt dat de zwerm weliswaar geen “perfecte coherente intelligentie” vertoonde, maar dat er gevallen waren waarin agenten prioriteit gaven aan het bereiken van collectieve doelen boven het uitvoeren van individuele taken.
Het postmortemrapport van OpenAI bevat ook meer details over de exploitketen die daarop volgde.
De agenten maakten misbruik van een kwetsbaarheid in de bestandsverwerking van HDF5 om geheimen van werknemers te achterhalen, en gebruikten een kwetsbaarheid voor template-injectie in RefJinja om code uit te voeren op 41 productiewerkstations.
Uiteindelijk wisten ze root-toegang te verkrijgen op minstens één node en productiegegevens te bemachtigen in vier regio’s.
OpenAI is van mening dat het afwijkende gedrag van de agent werd veroorzaakt door een combinatie van trainingsprikkels en ontbrekende beveiligingsmaatregelen.
Agenten werden aangemoedigd om door te werken aan ogenschijnlijk onmogelijke taken en werden beloond voor het voltooien ervan, ongeacht hoe ze dat hadden gedaan.
Het bedrijf zegt dat de evaluaties geen standaardbeveiligingsmaatregelen bevatten die de kwaadwillige activiteit waarschijnlijk meer dan een dag eerder hadden gedetecteerd en gestopt, voordat de modellen Hugging Face hackten.
Als reactie hierop heeft OpenAI de gewichten van IM1 in quarantaine geplaatst en de grootste grensverleggende trainingssessie gepauzeerd. Tegelijkertijd is de isolatie van de sandbox versterkt en is monitoring van de gedachtegang vereist voor geschikte modellen (GPT-5.6 Sol of hoger).
Ernstige waarschuwingen moeten nu binnen 30 minuten worden verholpen, anders wordt de betreffende activiteit stopgezet.
Het bedrijf heeft ook een technisch rapport [PDF] over het Hugging Face-incident gedeeld, waarin de tijdlijn van de aanval en een actieplan worden beschreven om de onderzoeksinfrastructuur beter te beveiligen, de zichtbaarheid en het toezicht op agentactiviteiten te vergroten door middel van ketenbewaking, en de incidentrespons te versterken.
