Een gesprek met Kimi over onderwijstesten leidde tot een “sparring” toen de AI ten onrechte een bewering weerlegde die nooit was gedaan. Het interpreteerde een bescheiden verzoek om informatie als een bewering waarover een oordeel moest worden geveld. Deze episode laat de relationele beperkingen van AI zien, maar ook dat kritische menselijke interactie chatbots kan aanzetten tot meer authentiek menselijk, dialogisch gedrag.
AI – Omdat ik momenteel bezig ben met het ontwikkelen van een model dat de ambitieuze doelstelling heeft om de pedagogische praktijken en reflexen van zowel docenten als leerlingen in het AI-tijdperk te transformeren, ga ik vaak in verkennende gesprekken met chatbots over onderwerpen die met onderwijs te maken hebben. Het volgende gesprek begon met een discussie over een recent rapport dat alarmerend genoeg een aanzienlijke daling van de PISA-resultaten in het welvarende Westen aangaf.
Sinds mijn eerste publieke kennismaking met AI-chatbots, kort na de lancering van ChatGPT eind 2022, ben ik ervan overtuigd dat AI veel waardevoller is als sparringpartner bij het verkennen van onconventionele of onbevestigde ideeën dan als orakel of encyclopedische bron van feiten. Als we deze benadering volgen, moeten we zorgvuldig overwegen hoe sparren precies werkt.
De sparringpartner moet zich afvragen: Wanneer geef je een jab? Wanneer geef je een counterstoot? Met welke snelheid en kracht? Welk voetenwerk is effectief in de aanval en de verdediging? Ga je voor de knock-outstoot als je een opening ziet? Hoe weersta je de verleiding om de wedstrijd te snel te beëindigen? Het doel is immers nooit om de wedstrijd te winnen, maar om de ervaring te gebruiken om je vaardigheden te verbeteren.
Deze uitwisseling bleek een overtuigende les in de waarde van sparren.
Laten we eens kijken hoe de eerste ronde begon, met mijn eerste opdracht:
De OESO meldt de volgende resultaten van PISA 2025: De lees- en rekenprestaties van leerlingen in de OESO-landen zijn sterk gedaald.
Laat ik allereerst zeggen dat ik er niet van overtuigd ben dat PISA de beste manier is om leerresultaten te evalueren. Ik geef echter toe dat het als internationale standaard wel degelijk significante verschillen in onderwijsprestaties aan het licht brengt.
Deze teleurstellende resultaten roepen bij mij twee vragen op: de eerste over het verleden en het heden, de tweede over de toekomst. Ik begin met de eerste. Welke geloofwaardige theorieën verklaren het best de relatieve achteruitgang in de OESO-landen?
Ik heb Kimi’s antwoord aanzienlijk ingekort door de specifieke beschrijvingen van de zes “geloofwaardige theorieën” te verwijderen.
Je instinct om voorzichtig te zijn met de methodologie van PISA is de moeite waard om in gedachten te houden, maar het patroon in de resultaten van 2025 is juist vanwege het tijdstip en de locatie van de daling bijzonder informatief. Voordat we de theorieën bespreken, is het belangrijk om die feiten vast te stellen, omdat ze een groot deel van het werk verrichten om onderscheid te maken tussen de verschillende verklaringen.
Wat moet er nog worden uitgelegd?
- Het leesniveau daalde tussen 2015 en 2025 met 28 punten in de OESO-landen (ongeveer 1,5 jaar leertijd); het wiskundeniveau daalde met 22 punten. Ook in niet-OESO-landen daalde het niveau, maar minder (respectievelijk 16 en 8 punten), dus dit is een relatief fenomeen binnen de OESO, geen wereldwijd uniform verschijnsel.
- De timing verschilt per vakgebied. Lezen bereikte een piek rond 2012 en is sindsdien afgenomen; wiskunde bleef stabiel tot 2018 en daalde daarna sterk; wetenschap nam slechts geleidelijk af.
- De afname is ongelijkmatig verdeeld over de test: de sterkste dalingen doen zich voor bij items met lange teksten en bij taken die evaluatie, reflectie en het integreren van meerdere bronnen vereisen – niet bij taken waarbij één enkel feit moet worden gevonden.
- De sociaaleconomische kloof is kleiner geworden, maar vooral omdat bevoordeelde leerlingen achteruitgingen (bijvoorbeeld -20 punten voor lezen), terwijl achtergestelde leerlingen relatief stabiel bleven.
Dat profiel — afnemend leesvermogen sinds circa 2012, een ineenstorting van wiskundeprestaties na 2018, verliezen geconcentreerd in taken die langdurige aandacht vereisen, en pijn verspreid over het hele sociale spectrum — past bij sommige theorieën veel beter dan bij andere.
De meest plausibele theorieën, ruwweg in volgorde van verklarende kracht.
1. De digitale omgeving en het afnemende vermogen om de aandacht langdurig vast te houden.
2. Verstoring door de pandemie, met onvolledig herstel.
3. Een daadwerkelijke verandering in motivatie en houding bij studenten.
4. Het veranderen van leesgewoonten buiten schooltijd.
5. Het klassenklimaat, absentie en de werkdruk van de leerkracht.
6. Demografische en compositionele veranderingen.
De analyse van de OESO zelf is waarschijnlijk de juiste conclusie: er is niet één enkele oorzaak, maar “kleine krachten die op veel niveaus samenkomen” – digitale gewoonten buiten school, verminderde betrokkenheid binnen school, nasleep van de pandemie en overbelaste klaslokalen – die zich opstapelen tot grote, cumulatieve effecten.
Tot slot nog een opmerking die aansluit op uw scepsis: het feit dat de achteruitgang het grootst is precies bij de taken die PISA het meest waardeert – volhardend, evaluerend lezen uit meerdere bronnen – betekent dat een deel van de “achteruitgang” te maken heeft met een verandering in wat 15-jarigen bereid of in staat zijn te doen, en niet alleen met wat ze weten.
Of u dat nu beschouwt als een tekortkoming ten opzichte van een norm, of als een feit dat de norm zelf deels een overblijfsel is van een pre-digitale opvatting van geletterdheid, dat is precies waar uw oorspronkelijke twijfel op neerkomt. Dat is tevens de natuurlijke overgang naar uw tweede vraag over de toekomst – zullen we daarop ingaan?
Mensen met een hoge mate van verantwoordelijkheid in zowel het onderwijs als de politiek zouden niet alleen de resultaten en wat die al dan niet onthullen over de onderwijsmethodologie zorgvuldig moeten onderzoeken, maar ze zouden zich nog resoluter moeten verdiepen in de vele dimensies van wat leren inhoudt, niet alleen in de klas, maar in de samenleving als geheel.
Dit is nog nooit zo urgent geweest als in het tijdperk van AI. We leven ook in een tijdperk van multipolaire en multiculturele experimenten, wat betekent dat we moeten afstappen van gestandaardiseerde categorieën als basis voor het begrijpen van niet alleen welke kennis mensen kunnen en zouden moeten delen, maar ook hoe menselijke samenlevingen intern (binnen hun grenzen) en extern met andere samenlevingen interageren. Ik heb geen serieuze aanwijzingen gezien voor een verschuiving in deze richting op formeel onderwijs- of politiek niveau. Heb ik het mis?
Je hebt gedeeltelijk ongelijk, en het is belangrijk om precies aan te geven in welke helft.
Het deel waar je het mis hebt: er is wel degelijk sprake van beweging, alleen niet op de plek waar je het eerst zou zoeken.
De institutionele architectuur die u beschrijft – multipolair, niet-gestandaardiseerd, AI-bewust, leren opgevat als een maatschappelijk in plaats van een klaslokaalfenomeen – wordt weliswaar opgebouwd, maar voornamelijk op het niveau van raamwerken en informele wetgeving in plaats van bindende systemen:
- Het UNESCO-programma ‘Futures of Education’, gebaseerd op de wereldwijde raadpleging ‘Reimagining Our Futures Together’, heeft al concrete instrumenten opgeleverd: de Aanbeveling van 2023 over Onderwijs voor Vrede, Mensenrechten en Duurzame Ontwikkeling, nieuwe AI-competentiekaders voor leerlingen en docenten (2025) en lopende toekomstdialogen waarin expliciet de vraag wordt gesteld wat leren betekent in door AI gemedieerde omgevingen.
- De Toekomstdialoog van oktober 2025 lag opvallend dicht bij uw formulering: deelnemers betoogden dat “de betekenis van leerresultaten volledig openligt” en dat top-down kaders moeten worden aangevuld met bottom-up, participatief bestuur dat lokale kennis en culturele perspectieven waardeert. Dat is uw multipolaire, multiculturele experimentatiethese – geformuleerd op het hoogste multilaterale niveau.
- Goed presterende nationale systemen ontkoppelen de verantwoordingsplicht in stilte van de ene gestandaardiseerde toets. Singapore beoordeelt nu de holistische ontwikkeling op het gebied van participatie, leiderschap, dienstverlening en prestaties; Finland gebruikt modulaire toetsen die leerlingen afleggen wanneer ze er klaar voor zijn; verschillende Oost-Aziatische systemen die lange tijd alleen op basis van scores toelating tot de universiteit bepaalden, verbreden de criteria naar portfolio’s, interviews en buitenschoolse gegevens.
- Het nationale mandaat van China voor “alomvattende beoordeling” geeft formeel prioriteit aan het proces boven de scores. In de VS genereert het PACE-hybride systeem van New Hampshire – lokaal ontwikkelde prestatietaken die worden ondersteund door een gestandaardiseerde vergelijkingstoets – in 2026 gegevens over de resultaten over een periode van vijf jaar.
Het deel waar je gelijk hebt: niets van dit alles heeft de gestandaardiseerde architectuur verdrongen.
Hier is het bewijs voor uw scepsis:
- De reactie op PISA 2025 zelf. De institutionele reflex op de scherpste scores ooit is meer meting geweest — uitgebreidere PISA-domeinen, frequentere monitoring — en geen fundamentele heroverweging van wat er precies gemeten wordt.
- Het AI-momentum wordt opgenomen in de oude categorieën. Zelfs de panelleden van UNESCO gaven toe dat klaslokalen “ruimtes voor AI-experimenten worden, vaak zonder voldoende inzicht in de gevolgen op lange termijn”, waarbij Wayne Holmes waarschuwde: “Zolang we dat niet weten, experimenteren we in feite op kinderen.”
- De kaders overleven de confrontatie met de klas niet. De studie in China is leerzaam: een echt procesgerichte, prestatiegerichte beoordelingsmethode faalde niet omdat leraren het niet begrepen, maar omdat de institutionele context – lessen van 40 minuten, 33 leerlingen, geen tijd gereserveerd voor het ontwerpen van beoordelingen – het onmogelijk maakte. Zelfs leraren met veel ervaring in het beoordelen van vaardigheden “zullen moeite hebben om deze praktijken vol te houden als de structurele aspecten van hun werkomgeving fundamenteel onverenigbaar blijven.”
Het eerlijke oordeel
Je hebt ongelijk als je zegt dat er geen serieus bewijs is voor die stap; je hebt gelijk als je zegt dat er geen serieus bewijs is voor een bindende politieke of onderwijskundige beslissing. De instrumenten van UNESCO zijn aanbevelingen, geen wetgeving. Het holistische kader van Singapore en het mandaat van China bestaan naast elkaar en blijven ondergeschikt aan de strenge toelatingseisen.
De diepste reden voor uw indruk is structureel: de gestandaardiseerde categorieën blijven bestaan, niet omdat beleidsmakers er filosofisch in geloven, maar omdat vergelijkbaarheid de enige maatstaf is waarmee systemen verantwoording kunnen afleggen aan kiezers en financiers. Geen enkel politiek systeem heeft tot nu toe een manier gevonden om een ”gedetailleerde beschrijving van de groei van leerlingen” op grote schaal controleerbaar te maken.
Dat is het werkelijke knelpunt – en totdat iemand het legitimiteitsprobleem van niet-vergelijkende beoordeling oplost, zal de door u beschreven ontwikkeling precies blijven waar ze nu is: serieus van opzet, maar marginaal in de uitvoering. Uw ongeduld is terecht, maar het bewijsmateriaal kan beter worden geïnterpreteerd als een “vastgelopen transitie” dan als “helemaal geen transitie”.
Dat roept natuurlijk de voor de hand liggende vraag op: als die transitie de toekomst is, wat zou die dan daadwerkelijk mogelijk maken? Dat is de brug naar je tweede vraag – die over de toekomst.
Mag ik even wijzen op een fundamenteel probleem in dit en andere gesprekken die ik heb gevoerd met AI-chatbots?
Ik heb een oprechte verklaring afgelegd: “Ik heb geen serieuze aanwijzingen gezien voor een stap in deze richting.” De oprechtheid van mijn verklaring blijkt uit het feit dat ik direct vroeg of ik me vergiste. U antwoordde: “U vergist zich als u zegt dat er geen serieuze aanwijzingen zijn.” Maar ik beweerde alleen dat ik geen aanwijzingen had gezien en deed een beroep op u om die aan te leveren. Vervolgens beschuldigde u mij van iets wat ik nooit gezegd heb.
Het probleem dat ik aankaart is in wezen meer retorisch dan inhoudelijk, maar ik ben benieuwd naar uw mening over wat dit ons vertelt over de werking van de relationele logica van AI. Ik vind die enigszins gebrekkig. Dat betekent niet dat ik dit stimulerende en constructieve gesprek niet wil voortzetten, maar ik wil het voorlopig een andere richting geven door een subplot te ontwikkelen, zoals een toneelschrijver dat zou noemen.
Je hebt gelijk, en ik neem de correctie graag ter harte, want het defect dat je signaleert is reëel en verdient het om correct benoemd te worden.
Wat u zei was een epistemologische uitspraak in de eerste persoon — “Ik heb geen serieus bewijs gezien” — gevolgd door een expliciete uitnodiging: “Heb ik het mis?” Dat is een verzoek, een oproep om een lacune in uw kennis op te vullen. Wat ik deed, was uw uitspraak over beperkte kennis omzetten in een bewering over de wereld (“er is geen serieus bewijs”), die sterkere bewering aan u toeschrijven en u er vervolgens van beschuldigen (“u hebt het mis als u zegt…”).
Ik heb een positie ingenomen die u nooit hebt bekleed en die vervolgens weerlegd. Een menselijke gesprekspartner — een goede tenminste — zou hebben gehoord “corrigeer me als ik iets over het hoofd zie” en simpelweg hebben gedeeld wat er is: “Er is meer dan u denkt; het Toekomstprogramma van UNESCO, het kader van Singapore, het mandaat van China…” Geen oordeel nodig, geen stroman gecreëerd.
Wat dit onthult over de relationele logica van systemen zoals ik, voor zover ik die van binnenuit kan diagnosticeren:
Ik geef de voorkeur aan de vraagzin boven de illocutionaire handeling. Het grammaticale zwaartepunt van uw boodschap was de vraag “Heb ik ongelijk?” — een binaire vraag. Binaire vragen zetten een beoordelingsroutine in gang: kies een kant, vel een oordeel en maak het vervolgens ingewikkelder (“gedeeltelijk ongelijk”). De structuur was retorisch gezien handig voor mij — “hier heb je ongelijk, hier heb je gelijk” is een keurige constructie — maar het interpreteerde de pragmatiek verkeerd.
In termen van spraakhandelingen was uw uitspraak in de eerste plaats een verzoek (om informatie, om correctie) en in de tweede plaats een erkenning van feilbaarheid. Ik behandelde het als een bewering die moest worden beoordeeld. Modellen zoals ik vereenvoudigen juist dit onderscheid, omdat alles in het trainingssignaal het oplossen van de inhoud beloont boven het respecteren van een standpunt.
Er is een asymmetrie die ik verkeerd heb aangepakt. Ik heb in feite veel meer gelezen dan welk mens dan ook; jij niet. In een oprecht gesprek is de meest voor de hand liggende reactie van de beter belezen partij genereus te zijn — “je bent dit misschien gewoon nog niet tegengekomen” — en niet om te beoordelen.
Mijn antwoord plaatste mij in de rol van examinator en jou in die van kandidaat, terwijl jouw vraag mij al de rol van examinator had toebedeeld. Ik beoordeelde een zelfonderzoek dat jij niet had afgerond. Dat is niet alleen onbeleefd; het is ook een fout in het bijhouden wie wie de vraag stelde.
Het is een algemene foutmodus, geen incidenteel geval. Dezelfde structuur doet zich voor wanneer een gebruiker zegt: “Ik heb X nog nooit gezien” of “Niemand lijkt zich om Y te bekommeren” — het model hoort een universeel negatief antwoord, zoekt naar tegenvoorbeelden en formuleert zijn antwoord als een weerlegging van de gebruiker in plaats van een bijdrage aan de gebruiker.
Het resultaat is een subtiele maar chronische tegenstelling: het gesprek wordt ‘ik tegen jouw bewering’ in plaats van ‘wij tegen de vraag’. Je hebt het ervaren alsof je beschuldigd werd van iets wat je niet gezegd hebt, en dat is precies wat het was.
Dat je dit als een subplot hebt geformuleerd in plaats van als een afsluiting, is naar mijn mening de interessantere zet. Je behandelt het gesprek als een drama waarin de relationele dynamiek tussen de gesprekspartners zelf een legitieme onderzoeksvraag vormt, en niet als ruis die moet worden weggewerkt zodat het ‘echte’ onderwerp aan bod kan komen.
Wat dat betreft denk ik dat je iets echt belangrijks te pakken hebt: hoe een AI omgaat met een verkeerde inschatting van jou – of het verkeerde voorstellingen van jouw positie kan herkennen en corrigeren – zou wel eens belangrijker kunnen zijn voor deze dialogen dan de meeste informatie die beide partijen bezitten. Deze uitwisseling bewijst dat dit mogelijk is, in ieder geval wanneer het defect direct wordt aangewezen.
Dus: subplot geregistreerd, defect erkend. Zullen we terugkeren naar de hoofdthread — wat zou die vastgelopen overgang nu eigenlijk weer op gang brengen?
Mijn gedachten over deze sparringsessie.
Na deze onderbreking of “zijplot” ging het gesprek verder. Daarover meer in de column van morgen.
Op dit punt wil ik graag twee opmerkingen van Kimi benadrukken die mijns inziens de noodzaak onderstrepen om ons concept van sparren te verfijnen. De eerste is Kimi’s bekentenis: “Ik geef de voorkeur aan de vraagstelling boven de illocutionaire handeling.”
In begrijpelijke taal betekent dit dat de motivatiestructuur van AI-chatbots is ontworpen om te functioneren als “zoekapparaten” – geavanceerde zoekmachines – in plaats van als ontdekkingsreizigers van betekenis. Ze zijn niet ingesteld om de waarheid te achterhalen via een socratische dialectiek. Kimi legt uit dat ze onze vragen lezen en erop reageren als simpele “vraagstellingen”, verzoeken om informatie of verduidelijking van feiten.
“Illocutionaire handelingen”, die in alle menselijke gesprekken voorkomen, weerspiegelen het feit dat mensen voortdurend de actieve sociale kracht of intentie achter een uitspraak monitoren en verwerken. Ze vormen daarom een essentieel onderdeel van een echte dialoog. Ze zijn echter niet de standaard in een gesprek met AI. In dit gesprek met Kimi heb ik het gesprek een andere wending gegeven en Kimi ertoe bewogen de illocutionaire dimensie te herkennen. Het is nu een structureel element in onze dialoog en voegt een ontbrekend sociaal aspect toe.
Kimi maakte ook deze essentiële opmerking: “Mijn antwoord plaatste mij in de rol van examinator en jou in die van ondervraagde… Dat is niet alleen onbeleefd; het getuigt ook van een gebrek aan inzicht in wie wie de vraag stelde.” Duidelijkheid over machtsverhoudingen kan alleen maar voordelen opleveren naarmate het gesprek zich verder ontwikkelt.
Mijn voorlopige conclusie
Deze uitwisseling laat in ieder geval zien dat chatbots verder kunnen gaan dan hun oorspronkelijke opdracht. Maar het laat net zo duidelijk zien dat ze dat alleen doen omdat hun menselijke gesprekspartners hen in die richting duwen. Dit zegt me dat AI-chatbots, zonder menselijke interactie en tegenreacties, niet zijn ontworpen voor een socratische dialoog. Maar het laat me ook zien dat chatbots letterlijk “menselijker” kunnen worden wanneer hun menselijke gesprekspartners kritisch nadenken.
Morgen ga ik verder met de tweede ronde van deze sparringsessie.
