Op 12 juni schortte het AI-laboratorium Anthropic de toegang tot zijn nieuwste Claude-modellen, Fable 5 en Mythos 5, op. Deze modellen waren drie dagen eerder uitgebracht.
Anthropic De maatregel kwam als reactie op een “exportcontrolerichtlijn” van de Amerikaanse overheid die het gebruik van de modellen verbiedt aan iedereen die geen Amerikaans staatsburger is.
The US government, citing national security authorities, has issued an export control directive to suspend all access to Fable 5 and Mythos 5 by any foreign national, whether inside or outside the United States, including foreign national Anthropic employees.
The net effect of…
— Anthropic (@AnthropicAI) June 13, 2026
Mythos is Anthropics krachtigste, ofwel meest baanbrekende, model. Toen het bedrijf het model in april aankondigde, zei het dat het te goed was in hacken om het direct vrij te geven. In plaats daarvan werd Mythos beschikbaar gesteld aan een handvol organisaties (voornamelijk Amerikaanse technologiebedrijven ) om te gebruiken voor het dichten van zwakke plekken in essentiële digitale systemen.
Fable is in principe hetzelfde model, maar met extra beveiligingsmaatregelen om te voorkomen dat het voor cyberbeveiligingsdoeleinden wordt gebruikt. Dit is wat vorige week openbaar werd gemaakt – en vrijwel direct werd stopgezet.
Anthropic en de regering-Trump staan lijnrecht tegenover elkaar.
Sinds begin 2025 is het conflict tussen Anthropic en de regering-Trump steeds verder geëscaleerd. De regering heeft Anthropic ervan beschuldigd ” woke AI ” te ontwikkelen en CEO Dario Amodei een ” ideologische gek ” genoemd.
De eerste meningsverschillen betroffen regelgeving rondom AI en het exportbeleid voor halfgeleiders . Het conflict verergerde toen Anthropic weigerde het Pentagon toestemming te geven om hun modellen te gebruiken voor binnenlandse surveillance en volledig autonome wapensystemen.
Het ministerie van Defensie reageerde door te dreigen Anthropic aan te merken als een “risico voor de toeleveringsketen”, een classificatie die militaire aannemers zou verplichten de banden met het bedrijf te verbreken .
Ontsnappingen uit de gevangenis
De Amerikaanse overheid heeft de reden voor de richtlijn van vorige week nog niet publiekelijk bekendgemaakt, maar Anthropic zegt te geloven dat de overheid op de hoogte is geraakt van een jailbreak : een methode om de beveiligingsmaatregelen in Fable te omzeilen die voorkomen dat de krachtigste functies van de game voor kwaadaardige doeleinden worden gebruikt.
Deze beveiligingsmechanismen classificeren gebruikersverzoeken als veilig of onveilig voordat ze aan het AI-model worden doorgegeven. Indien geactiveerd, leiden de beveiligingsmechanismen het verzoek door naar een minder krachtig model.
Volgens Anthropic was de zorg van de overheid dat de beveiligingsmaatregelen omzeild zouden kunnen worden om informatie te verkrijgen die bruikbaar is voor cyberaanvallen.
Beveiligingsmechanismen voor grote taalmodellen zijn niet waterdicht. Ze zijn grotendeels afhankelijk van het vermogen van het model zelf om de intenties van de gebruiker bij het doen van een verzoek te interpreteren.
Naast de inherente moeilijkheid van deze taak, werkt een grote online gemeenschap (die mijn collega’s en ik de Undersphere noemen) hard om AI-beveiligingsmechanismen te omzeilen. Anthropic erkent dat “perfecte jailbreak-resistentie voor geen enkele huidige modelaanbieder haalbaar is”.
Volgens Anthropic lijkt het onderzoek dat ten grondslag ligt aan de overheidsrichtlijn te zijn uitgevoerd door ingenieurs van Amazon, dat zowel een concurrent als een belangrijke investeerder van Anthropic is.
Maar dit was niet de enige relevante jailbreak. Binnen 48 uur na de release van Fable publiceerde een onderzoeker, die het pseudoniem “Pliny the Liberator” gebruikte, wat hij identificeerde als de volledige systeemprompt van Fable 5 op X en een GitHub-repository .
🚨 JAILBREAK ALERT 🚨
ANTHROPIC: PWNED 🫡
FABLE-5: LIBERATED 🦋let’s start with the 🐘…
the consensus seems to be that this has been one of the most disappointing model drops of all time, effectively preventing legitimate researchers from contributing their talents to our… pic.twitter.com/Z0vdPIt4vY
— Pliny the Liberator 🐉󠅫󠄼󠄿󠅆󠄵󠄐󠅀󠄼󠄹󠄾󠅉󠅭 (@elder_plinius) June 10, 2026
De systeemprompt is een verborgen reeks instructies die helpt bij het bepalen van het gedrag van een AI-model. Het is onduidelijk hoe de kennis van Fable’s systeemprompt in de praktijk gebruikt zou kunnen worden, maar het heeft wel de aandacht getrokken in de Undersphere.
Een verrassing – en een mysterie dat nog steeds voortduurt.
Het grootste probleem bij het beveiligen van grote taalmodellen zoals Fable is dat we niet volledig begrijpen hoe ze werken. Volgens Maximilian Kasy, econoom en expert in machine learning aan de Universiteit van Oxford, werken ze veel beter dan ze “zouden moeten” werken .
Grote taalmodellen hebben miljarden interne parameters en worden getraind op onvoorstelbaar grote hoeveelheden data met behulp van machine learning-methoden. Volgens Kasy zouden we van dergelijke systemen verwachten dat ze “overfit” zijn: goed in het reproduceren van patronen in hun trainingsdata, maar slecht in het generaliseren naar nieuwe situaties.
Moderne systemen zoals Claude en ChatGPT lijken echter wel in staat te zijn tot generalisatie. Kasy vergelijkt de moderne ontwikkeling van AI met alchemie: succesvol door vallen en opstaan, nog niet gebaseerd op een systematische theorie.
Daardoor is het gedrag van AI-modellen soms zelfs voor de makers ervan ondoorzichtig.
Moeilijk te reguleren
De ondoorzichtigheid van de technologie is een belangrijke reden waarom regulering zo moeilijk is. Overheden hebben geen onafhankelijke toegang tot de data, infrastructuur en expertise die ze nodig hebben om gepatenteerde, grensverleggende modellen te evalueren.
Het recente decreet van de Amerikaanse regering over AI-beveiliging, dat twee weken geleden werd gepubliceerd, weerspiegelt dit besef. Nu de regering de kracht van geavanceerde AI-modellen inziet, is ze overgestapt van een aanvankelijk afwachtende houding naar een oproep aan ontwikkelaars om hun modellen ter beoordeling aan te bieden vóór publicatie.
Die eis is een impliciete erkenning dat de overheid de bedrijven niet vertrouwt om volledig en grondig te evalueren wat hun eigen modellen kunnen doen en hoe ze misbruikt zouden kunnen worden. Het publiek ziet nog minder, en de gevolgen zijn meetbaar: uit een onderzoek dat vorig jaar in 25 landen werd gehouden, bleek dat mensen gemiddeld genomen meer dan twee keer zo bezorgd zijn over AI als dat ze er enthousiast over zijn.
De toekomst van AI-veiligheid
AI is een enorm gehypte technologie. Maar het lijdt geen twijfel dat het ook extreem krachtig en onvoorspelbaar is. Deze combinatie is, begrijpelijkerwijs, zeer gevaarlijk.
We kunnen niet vertrouwen op regelgeving, omdat de technologie zich sneller ontwikkelt dan dat ze zich kan aanpassen. Evenmin kunnen we vertrouwen op vangrails, omdat die omzeild zullen worden.
We hebben een bestuurskader nodig dat is ontworpen voor die eventualiteit: een kader dat de gevolgen van een mislukking kan voorspellen en aanpakken.
Een dergelijk kader moet mondiaal, participatief en gebaseerd op wederzijds vertrouwen zijn. Dit zijn zaken die de huidige Amerikaanse regering tot nu toe nauwelijks heeft weten te bewerkstelligen.
