Vroeger, als we wilden weten welk team het WK zou winnen, moesten we ons wenden tot zieners met kristallen bollen, waarzeggerij met theebladeren, of hopen dat Paul de Octopus ons zou vertellen wat er zou gebeuren.
WK-2026 Maar moderne datawetenschap kan een beter alternatief bieden. Als onderdeel van een team van statistici heb ik meegeholpen aan het trainen van een machine learning-algoritme om het meest waarschijnlijke verloop van het toernooi te voorspellen.
Probabilistische voorspellingen en gemanipuleerde dobbelstenen
Het algoritme dat we hebben ontwikkeld, werkt in twee stappen.
In de eerste stap worden geavanceerde statistische modellen en deskundige inzichten van bookmakers en transfermarkten gecombineerd om de sterkte van alle teams en hun spelers te bepalen. In de tweede stap bepaalt een machine learning-algoritme hoe de sterkte-inschattingen het beste gecombineerd kunnen worden met andere informatie over de teams.
Dit leverde een probabilistische voorspelling op voor elke mogelijke wedstrijd in het toernooi. Je kunt het zien als een paar verzwaarde dobbelstenen: in plaats van dat de getallen 1 tot en met 6 gelijke kansen hebben, hebben deze verzwaarde dobbelstenen verschillende kansen op het aantal doelpunten voor elk team.
Volgens onze voorspelling gooit Mexico bijvoorbeeld gemiddeld 1,9 doelpunten in de openingswedstrijd, terwijl tegenstander Zuid-Afrika gemiddeld slechts 0,7 doelpunten scoort. Dit betekent echter niet dat Mexico zeker zal winnen. Een overwinning voor Mexico is met 65% kans de meest waarschijnlijke uitkomst. Een gelijkspel is minder waarschijnlijk (21%), en een overwinning voor Zuid-Afrika is de minst waarschijnlijke uitkomst (14%).
‘Vuelve a casa, el fútbol vuelve a casa!’
Met behulp van verschillende paren verzwaarde dobbelstenen kan de uitslag van elke wedstrijd in het WK worden gesimuleerd. We hebben rekening gehouden met de officiële loting en alle FIFA-regels, inclusief de mogelijkheid van verlenging en penalty’s. We hebben de simulatie 100.000 keer uitgevoerd om het meest waarschijnlijke verloop van het toernooi te bepalen.
De resultaten tonen aan dat Spanje de favoriet is voor de titel met een winstkans van 14,5%, op de voet gevolgd door Engeland en Frankrijk, elk met 12,4%, en Duitsland met 11,2%.
Door het uitgebreide toernooi – dit WK telt 48 teams en vijf knock-outrondes – liggen de favorieten dicht bij elkaar. Portugal en Argentinië maken ook goede kansen op de titel, met respectievelijk 8,9% en 8,2%.
De Verenigde Staten hebben op hun beurt een goede kans om de ronde van 32 te bereiken: 78%. Dit is de hoogste kans in hun groep, die uit drie andere teams bestaat. In de knock-outfase, waar elke wedstrijd erop of eronder is, nemen de kansen dat het Amerikaanse team “overleeft” echter relatief snel af. De kans op een thuisoverwinning in de finale in het MetLife Stadium in New Jersey op 19 juli is slechts 1%.
Een diepere blik in de machinekamer
Ons machine learning-algoritme en de daaropvolgende simulaties worden gevoed door data, expertise en statistische modellen.
Ten eerste vormen alle nationale wedstrijden van de afgelopen acht jaar de basis voor een “retrospectieve” inschatting van de sterkte van de teams. Ten tweede wordt een “prospectieve” sterkte-inschatting verkregen uit de door verschillende internationale bookmakers gehanteerde quoteringen, die hun deskundige mening over het aankomende toernooi weerspiegelen.
Ten derde worden de individuele spelers beoordeeld op basis van hun bijdrage aan doelpunten op club- en nationaal niveau. En tot slot wordt de huidige kwaliteit en het toekomstige potentieel van de spelers weerspiegeld in hun verwachte marktwaarde. Deze waarden zijn te vinden op de website van Transfermarkt , die gebruikmaakt van een ‘wijsheid van de massa’-benadering om de onbekende, werkelijke marktwaarde te schatten.
Deze vier variabelen worden gecombineerd met een breed scala aan andere relevante input die de huidige situatie van de verschillende teams en de landen waar ze vandaan komen weerspiegelt. Dit omvat teamspecifieke details, zoals hun FIFA-ranking en het aantal spelers in de halve finales van de Champions League van dit jaar. We hebben ook landspecifieke sociaaleconomische factoren meegenomen, zoals het bbp per hoofd van de bevolking.
Om te bepalen of en hoe deze kenmerken relevant zijn voor de daadwerkelijke resultaten in een WK, werd een machine learning-algoritme gebruikt.
Hier wordt een zogenaamd random forest-model getraind, bestaande uit een groot aantal beslissingsbomen die elk een iets andere subset van de data vertegenwoordigen. Het algoritme is getraind op alle wedstrijden die sinds het WK 2006 op de grote voetbaltoernooien zijn gespeeld. Het koppelt zo de sterkte van een team, de marktwaarde en andere factoren aan het aantal gescoorde doelpunten in WK-wedstrijden. Deze informatie wordt vervolgens gebruikt om de dobbelstenen voor onze simulaties te manipuleren.
Meer informatie
Dit is niet de eerste keer dat ons team, bestaande uit Andreas Groll en Rouven Michels en collega’s van de TU Dortmund in Duitsland, Lars Magnus Hvattum van de Hogeschool Molde in Noorwegen, Gunther Schauberger van de TU München en ikzelf, samenwerkt om een WK-voorspelling te maken.
Bij het WK vrouwenvoetbal van 2019 voorspelden we correct dat de VS zou winnen. Bij het WK vrouwenvoetbal van 2023 en het WK mannenvoetbal van 2022 waren de winnaars – respectievelijk Spanje en Argentinië – niet onze favorieten, hoewel we ze wel als serieuze kanshebbers beschouwden.
Waar het uiteindelijk op neerkomt, is dat voorspellingen over waarschijnlijkheden gaan. Ons programma zal de winnaar niet met 100% zekerheid voorspellen, maar het zou het wel eens beter kunnen doen dan een weekdier met acht poten.
