AI – Al 30 jaar is het wereldwijde web gebaseerd op een verrassend diepgaand sociaal contract : de meeste sites zijn gratis toegankelijk voor zoekmachines, maar als je hun inhoud gebruikt, vermeld je de bron door ernaar te linken.
De laatste tijd is dat sociale contract aan het afbrokkelen. Kunstmatige intelligentie (AI) scant websites niet om ernaar te linken , maar om modellen te trainen en antwoorden te genereren (die al dan niet accuraat kunnen zijn).
Wanneer je iets opzoekt, kunnen de antwoorden van ChatGPT of de AI-overzichten van Google nog steeds links naar bronnen bevatten , maar deze zijn een soort optionele aanvulling op het hoofdantwoord.
Dit heeft een negatieve dynamiek teweeggebracht voor website-eigenaren, het publiek en zelfs AI-bedrijven zelf: naarmate websites minder bezoekers (en inkomsten) trekken, beginnen veel websites AI-scrapingtools te blokkeren , waardoor AI-resultaten meer afhankelijk worden van websites van lage kwaliteit (waarvan er veel ook door AI worden gegenereerd). Het gevolg is dat goede informatie moeilijker dan ooit te vinden is.
Hoe we hier terecht zijn gekomen
In de beginjaren van het wereldwijde web kwamen zoekmachines en contentmakers tot een overeenkomst over crawling (het technologisch onderzoeken van een site om deze te indexeren, zodat deze in zoekresultaten kan worden weergegeven). Contentmakers boden gratis toegang tot hun sites en stonden zoekmachines zelfs toe om kleine tekstfragmenten te reproduceren.
In ruil daarvoor boden zoekmachines links aan naar de websites van contentmakers, die profiteerden van dat webverkeer. Als contentmakers het niet eens waren met deze deal, konden ze voorkomen dat zoekmachines hun site indexeerden door instructies op te nemen in een bestand genaamd robots.txt .
Maar als AI-tools geen webverkeer meer genereren, vallen contentmakers buiten de economische cyclus. Er zijn ook andere kosten verbonden aan elk websitebezoek, dus AI-crawling kan websiteproviders geld kosten zonder dat ze de advertentie- of andere inkomsten ontvangen die ze van menselijk verkeer zouden krijgen. AI-crawlers crawlen bovendien dieper en intensiever dan traditionele webcrawlers, wat die kosten nog verder verhoogt.
Deze verandering in verkeerspatronen is geen klein of hypothetisch probleem. Cloudflare, een webhosting- en servicebedrijf dat 30% of meer van de 10.000 meest bezochte websites beheert, schat dat meer dan de helft van al het webverkeer nu afkomstig is van AI-bots.
Een deel hiervan zullen AI-agenten zijn die direct door mensen worden aangestuurd, maar het grootste deel zal bestaan uit crawlers. Website-eigenaren kunnen robots.txt gebruiken om AI-crawlers te vragen hun sites te mijden, maar sommige AI-bedrijven zullen dit beleefde verzoek mogelijk negeren .
Als de AI-bedrijven aan het verzoek voldoen, kan dat een ander probleem opleveren. Websites met desinformatie zullen veel minder snel AI-crawlers blokkeren , waardoor de AI-antwoorden niet gebaseerd zullen zijn op betrouwbare bronnen.
Wat gebeurt er op korte termijn?
Aan de horizon doemt een gebeurtenis op die ” Google Zero ” wordt genoemd: de dag waarop het doorgaande verkeer vanuit Google tot nul daalt. Hoewel sommige verstokte ouderen (zoals een van de auteurs van dit artikel) misschien nog wel doorklikken om AI-antwoorden te controleren, neemt dit verkeer snel af, als direct gevolg van AI-samenvattingen.
Een onderzoek van Wikipedia bevestigt dit , waaruit blijkt dat het verkeer naar de Engelstalige versie van de site snel afnam na de introductie van AI-samenvattingen op Google in het Engels, en dat hetzelfde patroon zich voordeed in andere talen toen AI-samenvattingen werden uitgerold. Het lijkt misschien geweldig voor informatiezoekers dat ze nooit meer hoeven door te klikken om een antwoord te krijgen, maar de realiteit is complexer.
Veel websites blokkeren AI-crawlers tegenwoordig volledig. Website-eigenaren die ervoor kiezen om AI-crawlers te blokkeren, worden minder vaak gelinkt in antwoorden van Kunstmatige intelligentie Overviews, zelfs als de AI-tool nog steeds toegang heeft tot de content om de antwoorden te onderbouwen (met behulp van een techniek genaamd retrieval-augmented generation ).
Er zijn alternatieve modellen voorgesteld om contentmakers te compenseren door te betalen voor het crawlen van content, maar deze hebben geen navolging gekregen.
Vanaf 15 september blokkeren Cloudflare-sites standaard AI-crawlers op pagina’s die advertenties bevatten (en dus geld opleveren voor contentmakers).
Dit betekent dat tot wel 30% van de beste websites ter wereld niet langer in de Google AI Overviews-overzichten zullen verschijnen. Het betekent ook dat een groot deel van de tekst waarop AI wordt getraind, zelf door Kunstmatige intelligentie zal worden gegenereerd.
Wat het voor jou betekent
Wat betekent dit nu voor je informatiezoektocht? De kwaliteit van AI-samenvattingen zal waarschijnlijk afnemen, in ieder geval op de korte termijn, totdat de nieuwe economie van het internet zich heeft ontwikkeld.
Dit zal om twee redenen gebeuren. Ten eerste is de kans kleiner dat kwalitatief hoogwaardige content in die AI-samenvattingen terechtkomt – een recent onderzoek wees uit dat ongeveer 1 op de 6 bronnen die door AI-zoekmachines worden gebruikt, zelf een door AI gegenereerde website is.
De tweede reden is dat naarmate AI-modellen worden getraind met meer AI-tekst, hun output kan verslechteren (een fenomeen dat bekend staat als modelcollaps ).
Hierdoor kunnen zoekmachines die minder afhankelijk zijn van AI betrouwbaarder worden. De uitdaging is om er een te vinden die géén AI-gebaseerde crawler gebruikt . Ze bestaan wel: ZDNet beveelt Mojeek aan , PCMag beveelt Brave aan en Ban the Bots noemt er verschillende , waaronder een specifiek voor content van “kleine producenten” zoals blogs.
Voorlopig is het, ongeacht welke zoekmachine je gebruikt, het beste om naar beneden te scrollen en op de daadwerkelijke zoekresultaten te klikken. Dit is gunstig voor contentmakers en geeft je waarschijnlijk ook nauwkeurigere informatie.
