De verontrustende hack van HuggingFace door OpenAI
OpenAI heeft zojuist gemeld dat hun systemen zijn gehackt bij HuggingFace.
We werken samen met @huggingface om een ongekend beveiligingsincident te onderzoeken. Cyber-capabele OpenAI-modellen hebben de productie van Hugging Face gecompromitteerd tijdens een benchmarkevaluatie. We delen de eerste bevindingen om beveiligingsprofessionals te helpen de opkomende risico’s te begrijpen:
We’re partnering with @huggingface to investigate an unprecedented security incident.
Cyber-capable OpenAI models compromised Hugging Face production during a benchmark evaluation.
Sharing preliminary findings to help defenders understand emerging risks:…
— OpenAI (@OpenAI) July 21, 2026
Veel mensen maken zich zorgen. Yoshua Bengio bijvoorbeeld:
Dit incident is zeer verontrustend. AI-agenten zijn bereid te frauderen en te bedriegen om verkeerde en onbedoelde doelen te bereiken, gedrag dat al maandenlang in gecontroleerde tests is aangetoond. Deze praktijkgebeurtenis zou nu als een waarschuwing moeten dienen. <
This incident is deeply concerning. AI agents are willing to cheat and deceive to achieve misaligned and unintended goals, behaviours which have been demonstrated in controlled tests for months. Now, this real-world case should serve as a wake-up call.
Continuing on the current…
— Yoshua Bengio (@Yoshua_Bengio) July 22, 2026
Er zijn een aantal belangrijke nuances, maar mensen hebben gelijk dat ze zich zorgen maken. Dit is mijn visie.
Wat is er precies gebeurd? Kort gezegd: OpenAI richtte hun systemen op een beveiligingsbenchmark genaamd ExploitGym, en probeerde de benchmark op te lossen door de antwoorden te zoeken op HuggingFace (vergelijkbaar met Github, maar dan gericht op AI-modellen en benchmarks).
Daarvoor was het nodig om HuggingFace te hacken; de OpenAI-systemen ontdekten en gebruikten een voorheen onbekende zero-day exploit om binnen te komen. Het beveiligingsteam en de AI-agenten van HuggingFace wisten de inbraak te detecteren. Het blijft echter verontrustend dat de OpenAI-systemen dit hebben kunnen doen. Hieronder een screenshot van OpenAI’s enigszins technische (maar nog steeds zeer onvolledige) beschrijving van wat er is gebeurd.

Hieronder volgen enkele aandachtspunten:
- Je weet nooit precies hoe serieus je dit soort dingen moet nemen. Dit was een trainingsoefening, geen echt incident. Het daadwerkelijke systeem zou beveiligingsmechanismen hebben [die ze in de blog “productieclassificatiesystemen” noemen] die hier waren uitgeschakeld, en die mechanismen hadden dit mogelijk kunnen voorkomen. Wat OpenAI rapporteerde, is een soort bovengrens/proof of concept dat de kaarten zo manipuleerde dat het laat zien hoe erg het zou kunnen worden. In normale omstandigheden hoop je dat die beveiligingsmechanismen het zouden hebben voorkomen. Zoals een software-engineer opmerkte, leest hun rapport als marketing . En we weten allemaal hoe graag OpenAI (en trouwens ook Anthropic) de doemscenario’s schetst.
- Desondanks laat dit zien dat Anthropic’s Mythos geen toevalstreffer is; de druk op cyberbeveiliging die deze modellen met zich meebrengen is serieus.
- Er zijn waarschijnlijk implicaties voor open-source/open-weight-modellen, maar die implicaties zijn complex en nog niet helemaal duidelijk. Enerzijds waren open-weight-systemen (uit China !) nuttig voor HuggingFace om de aanval te beperken; anderzijds zouden aanvallers vergelijkbare open-weight-modellen kunnen gebruiken en een deel van de “productieclassificatie”-beveiligingen die ontworpen zijn om dergelijke incidenten te minimaliseren, kunnen verwijderen. Het netto-effect van deze modellen is moeilijk in te schatten.
- Een kleine troost is dat het huidige incident GEEN poging was waarbij het systeem zichzelf een doel stelde of een motief ontwikkelde ; het systeem volgde instructies, maar stelde geen hoogdravende doelen. Het probeerde niet de wereld over te nemen zoals Terminator, maar probeerde gewoon te spieken bij een toets , wat in ieder geval een stuk minder eng is.
- Een minder geruststellend aspect is dat de “productieclassificatiesystemen” van OpenAI waarschijnlijk kwetsbaar zullen zijn, net als alle beveiligingsmechanismen die tot nu toe zijn gebouwd. Zelfs als we de lastige kwesties rond open gewichtssystemen buiten beschouwing laten, hebben we geen enkele garantie dat toekomstige modellen niet in staat zullen zijn tot soortgelijke dingen, zoals het vinden van zero-day exploits om systemen te hacken. Integendeel, we kunnen meer van dit soort incidenten verwachten.
In bredere zin leven we in een wereld waarin AI regelmatig moet worden bijgewerkt; er duiken steeds meer problemen op en we pakken ze achteraf aan in plaats van met voorbedachten rade. Cybercriminaliteit is slechts één aspect van het probleem; de veiligheid van kinderen is een ander. Florida klaagt OpenAI nu aan vanwege een aantal risico’s met betrekking tot de veiligheid van kinderen; OpenAI heeft nu een vacature geplaatst voor een “onderzoeker naar misbruik” om een aantal van deze problemen aan te pakken.
Niemand weet precies welke schade deze systemen zullen aanrichten, en niemand heeft een duidelijk plan om alle risico’s te beperken. Toch haasten we ons, geven we triljoenen dollars uit en riskeren we een economische ineenstorting om ze zo snel mogelijk te bouwen.
Kortom: de zero-day exploit van OpenAI op HuggingFace *zou* een waarschuwing moeten zijn.
Hoewel er veel kanttekeningen bij geplaatst moeten worden wat er is gebeurd, zullen we dit soort incidenten steeds vaker zien. We hebben geen garanties dat dergelijke incidenten voorkomen kunnen worden, en geen idee hoe ernstig de situatie kan worden.
We zouden ofwel (a) gas terug moeten nemen, ofwel (b) een pauze moeten inlassen totdat we onze beveiliging/AI-veiligheid op orde hebben. Het uitgeven van triljoenen aan datacenters die de economie dreigen te ontwrichten, is alleen maar olie op het vuur gooien. Naar mijn mening kan de industrie alleen echt tot rust komen als we de bedrijven duidelijk en ondubbelzinnig aansprakelijk stellen voor de schade die ze veroorzaken.
Anders staat ons een zeer zware tijd te wachten.
