Reuters en Time blokkeren standaard AI-crawlers van hun websites. Alleen goedgekeurde bots krijgen nog toegang via een zogenoemde allowlist. Dit is een duidelijke verschuiving in hoe grote nieuwsmedia omgaan met het gebruik van hun content voor het trainen van AI-modellen.

Wat er aan de hand is

Steeds meer nieuwswebsites, waaronder Reuters en Time, zetten hun robots.txt-bestand zo aan dat AI-crawlers standaard worden geweerd. In plaats van alle bots toe te staan, werken ze met een allowlist: alleen vooraf goedgekeurde crawlers mogen nog binnenkomen. Dit is een reactie op de groeiende praktijk van AI-bedrijven die zonder toestemming grote hoeveelheden content scrapen om hun modellen te trainen. Volgens Search Engine Journal gaat het om een trend die zich door de hele nieuwssector verspreidt. Het is een manier voor uitgevers om meer controle te krijgen over wie hun content gebruikt en onder welke voorwaarden.

Wat dit betekent

Voor jou als ondernemer of professional heeft deze ontwikkeling twee kanten. Aan de ene kant laat het zien dat het beschermen van eigen content tegen ongevraagd AI-gebruik steeds normaler wordt. Als grote partijen als Reuters en Time dit doen, wordt het ook voor kleinere bedrijven relevanter om na te denken over hoe hun content wordt gebruikt. Aan de andere kant kan het blokkeren van AI-crawlers invloed hebben op hoe jouw content wordt gevonden. Sommige AI-tools gebruiken deze crawlers om informatie te verzamelen die ze vervolgens in antwoorden verwerken. Als jouw site AI-crawlers blokkeert, loop je het risico dat je niet meer in die antwoorden verschijnt. Dat kan een gemiste kans zijn als je zichtbaarheid zoekt via AI-zoekmachines of chatbots.

Hoe je dit kunt toepassen

Als je een eigen website of blog beheert, kun je overwegen om je robots.txt-bestand aan te passen. Een mogelijkheid is om AI-crawlers te blokkeren, maar alleen als je zeker weet dat dit geen negatieve invloed heeft op je vindbaarheid in gewone zoekmachines zoals Google. Je zou kunnen beginnen met het identificeren van welke AI-crawlers je site bezoeken via je serverlogs. Vervolgens kun je in je robots.txt een regel toevoegen die deze crawlers weert, terwijl je Googlebot en Bingbot gewoon toestaat. Een voorbeeldregel is: User-agent: GPTBot Disallow: /. Test altijd of je site nog normaal wordt geïndexeerd door Google nadat je de wijziging hebt doorgevoerd.

Als je content deelt via een nieuwsbrief of blogplatform, kun je nadenken over licentievoorwaarden. Grote uitgevers werken met allowlists, maar voor een MKB-bedrijf is dat vaak te complex. Een eenvoudigere stap is om in je algemene voorwaarden of copyrightverklaring expliciet te vermelden dat AI-scraping niet is toegestaan zonder voorafgaande toestemming. Dit geeft je een juridische basis als je ongewenst gebruik ontdekt. Je kunt ook overwegen om je content te publiceren op platformen die standaard AI-crawlers blokkeren, zoals sommige niche-nieuwswebsites.

Als je afhankelijk bent van AI-tools voor marktonderzoek of concurrentieanalyse, wees je er dan van bewust dat de data die deze tools gebruiken mogelijk minder volledig wordt. Grote nieuwsbronnen zoals Reuters en Time worden mogelijk niet meer meegenomen in de training van AI-modellen. Dit betekent dat je niet blindelings kunt vertrouwen op AI-antwoorden voor actuele of specifieke informatie uit deze bronnen. Een optie is om zelf direct de websites van deze nieuwsmedia te raadplegen voor belangrijke ontwikkelingen, in plaats van te leunen op samenvattingen van AI-assistenten.

Als je een webshop runt en afhankelijk bent van content van derden, zoals productrecensies of nieuwsartikelen, controleer dan of die bronnen AI-crawlers blokkeren. Als dat het geval is, kan het zijn dat AI-tools die jij gebruikt voor bijvoorbeeld prijsvergelijkingen of trendanalyses minder accurate informatie geven. Overweeg om directe API’s of RSS-feeds van deze bronnen te gebruiken in plaats van te vertrouwen op AI-gebaseerde scrapers. Dit geeft je meer controle over de kwaliteit en actualiteit van de data die je binnenkrijgt.

Bron: Search Engine Journal