Gehackte broncode onthult hoe Suno tientallen jaren aan muziek en podcasts van het internet heeft verzameld om zijn AI-tool te trainen.
De AI-tool voor het genereren van muziek, Suno, heeft miljoenen nummers en songteksten verzameld van YouTube Music, Deezer en Genius, maar ook van de stockmuziekbibliotheken Pond5, Jamendo, Freesound, het International Music Score Library Project en podcasts via RSS-feeds. Dit blijkt uit gegevens van een hacker die het bedrijf heeft gehackt en data over Suno’s trainingsbibliotheken heeft gedeeld met 404 Media. De hacker kreeg ook toegang tot gebruikersgegevens van honderdduizenden klanten van Suno, evenals betaalgegevens van Stripe, aldus de media.
De gehackte data biedt een zeldzame inkijk in hoe AI-modellen en -tools precies worden gebouwd. Suno is een van de grootste AI-tools voor het genereren van muziek op internet en is onderwerp geweest van verschillende grote rechtszaken van de platenindustrie, die het bedrijf ervan beschuldigde miljoenen auteursrechtelijk beschermde nummers te hebben getraind.
In het kader van deze rechtszaken gaf Suno eerder toe dat het getraind was op “vrijwel alle muziekbestanden van redelijke kwaliteit die toegankelijk zijn op het open internet”, waaronder in totaal “tientallen miljoenen opnames”. Suno heeft betoogd dat het trainen op auteursrechtelijk beschermde werken in die gevallen is toegestaan op grond van fair use, en een van die zaken is inmiddels geschikt.
De rechtszaken hebben duidelijk gemaakt dat Suno inderdaad enorme hoeveelheden auteursrechtelijk beschermd materiaal gebruikte voor zijn trainingen, maar de gehackte gegevens die met 404 Media zijn gedeeld, werpen meer licht op hoe Suno nummers van internet schraapte en waar ze vandaan kwamen. De Recording Industry Association of America beschuldigde Suno ervan nummers rechtstreeks van YouTube te kopiëren ; de gehackte gegevens die 404 Media heeft ingezien, bevestigen dit.
Het gehackte materiaal bevat broncode die vermoedelijk uit 2023 en 2024 stamt en die instructies voor het scrapen van gegevens en details over de omvang van ten minste een deel van het scrapen bevat. Zo vermelden de opmerkingen in een bestand dat er gegevens zullen worden opgehaald van “genius_hq, youtube_music, freesound, jamendo, imp, deezer, ytm_tagged” en dat “niet-muziek zal worden gefilterd”.
Een bestand met de naam “youtube_music” vermeldt dat het bij de laatste update “2.013.545 muziekclips” had verzameld. Een ander bestand bevat opmerkingen over verschillende datasets die Suno had gemaakt, waaronder “113.879 uur aan YouTube-muziek”, “17.615 uur aan Genius HQ”, “410 uur aan gratis geluid”, “19.514 uur aan IMSLP”, “3.726 uur aan Jamendo”, “62.117 uur aan Pond5-muziek”, “12.287 uur aan Deezer”, “152.162 uur aan YTM-tags” en “103 uur aan MuseScore-teksten”. In totaal gaat het om muziek van minstens tientallen jaren.

Andere code die de hacker met 404 Media deelde, leek specifiek te zoeken naar zang door op YouTube te zoeken naar a capella-versies van nummers. De code suggereerde ook dat Suno proxies gebruikte om nummers van YouTube te scrapen via een bedrijf genaamd Bright Data , dat scrapingtools, infrastructuur en datadiensten verkoopt.
Aanvullende code laat zien dat Suno met behulp van een online tool genaamd PodcastIndex 420.000 verschillende podcasts identificeerde die minstens vijf afleveringen van 30 minuten hadden en probeerde ongeveer 1 miljoen uur aan podcasts te downloaden.
Uit de bestanden die 404 Media heeft ingezien, is niet duidelijk hoe Suno precies bestanden van de andere platforms heeft verzameld. Pond5 is een stockmuziek- en geluidseffectenbibliotheek van Shutterstock, waar klanten betalen om individuele nummers te beluisteren of een beperkt aantal nummers per maand kunnen beluisteren met een abonnement.
Pond5 beweert 2,5 miljoen muzieknummers te hebben; de gegevens van Suno suggereren dat een aanzienlijk deel van de gehele bibliotheek is verzameld. Genius host daarentegen geen nummers direct op zijn website, maar stelt Apple Music-abonnees in staat om muziek via de website af te spelen of fragmenten van nummers via Apple Music te beluisteren.

In een van de processtukken stelde Suno dat de trainingsdata “in principe alle muziekbestanden van redelijke kwaliteit omvatten die toegankelijk zijn op het open internet, ongeacht betaalmuur, wachtwoordbeveiliging of dergelijke, in combinatie met eveneens beschikbare tekstuele beschrijvingen”, en dat deze “is samengesteld door het programma tientallen miljoenen voorbeelden van verschillende soorten opnames te laten zien, verzameld uit openbaar beschikbare bronnen”.
“Voor Suno in het bijzonder hield dit proces in dat ze tientallen jaren aan ’s werelds populairste geluidsopnamen kopieerden en die kopieën vervolgens in Suno’s AI-modellen invoerden, zodat die output konden genereren die de kwaliteiten van authentieke menselijke geluidsopnamen nabootste”, schreef de RIAA in haar rechtszaak tegen Suno.
“En om het nog erger te maken, verkreeg Suno die kopieën in eerste instantie door ze illegaal te ‘streamrippen’ van het populaire streamingplatform YouTube, en zo de technologische maatregelen te omzeilen die specifiek ontworpen waren om dergelijk ongeoorloofd kopiëren te voorkomen.”
In een verklaring zei een woordvoerder van Suno: “Zoals we in openbare documenten en bekendmakingen hebben aangegeven, zijn de AI-modellen van Suno getraind op openbaar beschikbare muziekbestanden en bijbehorende metadata die toegankelijk zijn op websites van derden op het open internet. In november 2025 hebben we vastgesteld dat Suno het doelwit was geweest van een beperkt beveiligingsincident dat snel onder controle werd gebracht.
Destijds hebben we onmiddellijk een onderzoek ingesteld en bevestigd dat het incident voornamelijk betrekking had op verouderde broncode die niet langer in gebruik is bij Suno en dat er geen gevoelige persoonlijke informatie is gecompromitteerd. Belangrijk is dat Suno geen toegang heeft tot de volledige creditcardnummers van klanten in Stripe.”
“Gezien de beperkte aard van de klantgegevens die vermoedelijk betrokken zijn, hebben we vastgesteld dat individuele meldingen niet nodig waren volgens de geldende privacywetgeving”, voegde de woordvoerder van Suno eraan toe. Suno verstuurde tevens een verklaring over trainingsgegevens, zoals vereist door de Californische wetgeving.
De hacker, ellie.191, vertelde 404 Media dat ze het bedrijf hadden gehackt door een individuele medewerker te hacken met behulp van de Shai-Hulud-worm , een supply chain-aanval waarmee hackers GitHub- en cloudservice-inloggegevens konden bemachtigen. Ze zeiden ook toegang te hebben gekregen tot de klantenlijst van Suno, inclusief e-mailadressen en/of telefoonnummers van klanten en Stripe-betaalgegevens, afhankelijk van de gebruikte inlogmethode.
De hacker gaf een aantal voorbeelden van klanten, van wie sommigen aan 404 Media bevestigden dat ze hun telefoonnummer hadden gebruikt om zich bij Suno aan te melden en zeiden dat ze nooit op de hoogte waren gesteld van een datalek. De hacker vertelde 404 Media dat ze geen specifieke motivatie hadden om Suno te hacken en zei: “Ik hack graag alles en iedereen.”
404 Media heeft eerder bericht over gelekte documenten waaruit bleek dat Nvidia en Runway ML massaal content van YouTube hebben gescrapet . Over het algemeen ontkennen AI-bedrijven niet langer dat ze getraind zijn op auteursrechtelijk beschermd materiaal, maar voeren ze aan dat ze het werk van artiesten mogen scrapen op grond van uitzonderingen op de auteursrechtwetgeving die het recht op redelijk gebruik garanderen.
Vorige maand berichtte The Atlantic over verschillende muziekdatabases die veelvuldig worden gebruikt voor AI-training en die miljoenen nummers bevatten: “Drie van de datasets die ik vond, worden verspreid als een lijst met links naar nummers op YouTube of Spotify. AI-ontwikkelaars downloaden de daadwerkelijke audio met behulp van tools die dit proces automatiseren.
Sommige van deze tools stellen ontwikkelaars in staat om inlogprocedures, advertenties en mechanismen die makers geld of abonnees zouden kunnen opleveren, te omzeilen. Dergelijke tools schenden de gebruiksvoorwaarden van deze platforms. (De vierde dataset, de Free Music Archive-collectie, wordt verspreid met MP3’s.)”, schreef de auteur van het artikel in The Atlantic. Het is onduidelijk of Suno een van deze datasets heeft gebruikt.
De woordvoerder van Suno voegde eraan toe dat het bedrijf er alles aan heeft gedaan om te voorkomen dat gebruikers nummers genereren die op bestaande nummers lijken. Een van de argumenten in verschillende rechtszaken was dat Suno gebruikt zou kunnen worden om nummers te produceren die bijna niet te onderscheiden zijn van bestaande werken. “Ons doel is altijd geweest om mensen te helpen originele nieuwe muziek te creëren, niet om die van iemand anders te kopiëren.
Daarom bouwen we onze modellen rond wat we ‘Originele Creatie, Door Ontwerp’ noemen. We gebruiken bijvoorbeeld bewust geen artiestennamen als categorie trainingsmetadata, omdat we willen dat onze modellen mensen helpen om gloednieuwe nummers te creëren, en niet muziek die het bestaande werk van andere artiesten kopieert”, aldus de woordvoerder.
“Wij vinden dat artiesten zowel nieuwe kansen als sterke bescherming verdienen. Daarom hebben we geïnvesteerd in beveiligingsmaatregelen die zijn ontworpen om imitatie en andere vormen van misbruik te voorkomen, terwijl we tegelijkertijd technologieën voor AI-identificatie blijven ontwikkelen.”
Mikey Shulman, de CEO en oprichter van Suno, zei vorig jaar in een podcast dat hij gelooft dat “de meeste mensen niet genieten van het grootste deel van de tijd die ze besteden aan het maken van muziek.”
