Het antwoord op de vraag wat de blokkades van AI-crawlers door nieuwsmedia voor jouw contentstrategie betekenen, is dat je zelf ook maatregelen moet nemen om te voorkomen dat jouw unieke content gratis wordt gebruikt om AI-modellen te trainen. Tegelijkertijd biedt het kansen om je distributiekanalen te heroverwegen en te investeren in kanalen waar AI geen vat op heeft.
Wat er aan de hand is
Reuters en Time hebben hun websites standaard zo ingesteld dat ze AI-crawlers blokkeren. Alleen goedgekeurde crawlers, die op een zogenoemde ‘allowlist’ staan, krijgen nog toegang. Dit is een groeiende trend onder nieuwssites en andere uitgevers, die steeds meer weerstand bieden tegen het ongevraagd schrapen van hun content voor AI-training. Volgens Search Engine Journal voegen steeds meer publicaties ‘frictie’ toe aan het proces van AI-content scraping. Dit betekent dat ze niet alleen technische blokkades opwerpen, maar ook juridische stappen overwegen of hun algemene voorwaarden aanpassen. De beweging is een directe reactie op AI-bedrijven die zonder toestemming of vergoeding grote hoeveelheden content gebruiken om hun modellen te trainen.
Wat dit betekent
Voor jou als ondernemer of professional betekent deze ontwikkeling twee dingen. Ten eerste: als grote nieuwsmedia zoals Reuters en Time het nodig vinden om zich te beschermen, dan is de kans groot dat jouw eigen content – denk aan blogartikelen, whitepapers, productbeschrijvingen of handleidingen – ook wordt gescraped. Zeker als je unieke, waardevolle informatie deelt die AI-modellen graag willen leren. Ten tweede: de strategie van deze uitgevers laat zien dat er een verschuiving plaatsvindt. Waar content vroeger vooral werd gezien als een manier om vindbaar te zijn in zoekmachines, wordt het nu ook een asset die je actief moet beschermen. Dit raakt niet alleen grote mediaconcerns, maar ook MKB-bedrijven die afhankelijk zijn van hun online content voor klantwerving en -binding.
Hoe je dit kunt toepassen
Als je een eigen website of blog beheert met unieke content, overweeg dan om je robots.txt-bestand aan te passen. Dit is een eenvoudig tekstbestand op je server waarin je aangeeft welke crawlers wel en niet welkom zijn. Je kunt specifieke AI-crawlers blokkeren, zoals die van OpenAI of Google’s Bard, door regels toe te voegen. Een mogelijkheid is om alleen crawlers toe te staan die je kent en vertrouwt, zoals die van Google voor zoekresultaten. Je zou ook kunnen overwegen om een allowlist te maken, net zoals Reuters en Time doen, zodat je precies weet wie je data gebruikt.
Als je content deelt op platforms van derden, zoals LinkedIn, Medium of een nieuwsbriefplatform, is het goed om te beseffen dat die platforms mogelijk andere regels hanteren. Je kunt niet altijd controleren of zij AI-crawlers blokkeren. Een optie is om je meest waardevolle content exclusief op je eigen website te publiceren en alleen samenvattingen of teasers op externe platforms. Zo behoud je de controle over de volledige content en kun je zelf bepalen wie er toegang toe heeft.
Als je een team aanstuurt dat content produceert, is het verstandig om een beleid op te stellen rond contentbescherming. Bespreek met je team welke content je wilt beschermen en hoe. Je zou kunnen afspreken dat alle nieuwe content standaard wordt voorzien van een duidelijke copyrightvermelding en dat het robots.txt-bestand regelmatig wordt gecontroleerd. Een andere mogelijkheid is om te investeren in een contentmanagement-systeem dat geavanceerdere beveiliging biedt, zoals het toevoegen van captcha’s of rate limiting op pagina’s met veel verkeer van bots.
Als je afhankelijk bent van AI-tools voor je eigen werk, bijvoorbeeld voor het genereren van marketingteksten of analyses, wees je er dan van bewust dat jouw eigen content mogelijk ook als trainingsdata wordt gebruikt. Overweeg om je eigen content te markeren met een ‘noai’-tag in de HTML, een relatief nieuwe standaard die sommige AI-bedrijven respecteren. Dit is geen garantie, maar het is een extra signaal dat je niet wilt dat je werk wordt gescraped. Je kunt ook je algemene voorwaarden aanpassen en expliciet vermelden dat scraping voor AI-doeleinden niet is toegestaan.
De praktische toepassing hangt af van jouw situatie, maar de kern is: kijk kritisch naar hoe jouw content wordt gebruikt en neem zelf de regie over wie er toegang toe heeft.
Bron: Search Engine Journal