Het antwoord: Reuters en Time blokkeren standaard AI-crawlers, wat betekent dat hun content niet meer zomaar in AI-tools zoals ChatGPT verschijnt. Dit heeft directe gevolgen voor de zichtbaarheid van jouw MKB-content in diezelfde tools, maar biedt ook een kans om je eigen site strategisch te beschermen of juist open te stellen.
Wat er aan de hand is
Volgens Search Engine Journal hebben Reuters en Time hun websites zo ingesteld dat ze standaard alle AI-crawlers blokkeren. Alleen goedgekeurde crawlers, via een zogenaamde allowlist, krijgen nog toegang. Dit is een groeiende trend onder nieuwssites, die steeds vaker maatregelen nemen om te voorkomen dat AI-bedrijven hun content zonder toestemming schrapen voor het trainen van modellen of het genereren van antwoorden. De blokkades worden technisch afgedwongen via het robots.txt-bestand, een standaardprotocol dat aangeeft welke bots een site wel of niet mogen bezoeken.
Wat dit betekent
Voor jou als ondernemer betekent dit dat de content die je in AI-tools zoals ChatGPT of Google Search ziet, steeds vaker afkomstig is van sites die AI-crawlers toelaten. Als jouw eigen site AI-crawlers blokkeert, loop je het risico dat je minder zichtbaar bent in AI-gegenereerde antwoorden. Aan de andere kant: als je je site openstelt, kan jouw content juist vaker worden gebruikt als bron. Dit is vooral relevant voor sectoren zoals marketing, journalistiek en e-commerce, waar actuele en betrouwbare informatie een concurrentievoordeel geeft. De trend laat zien dat uitgevers hun content actief beschermen, wat de kwaliteit en herkomst van informatie in AI-tools kan beïnvloeden.
Hoe je dit kunt toepassen
Als je een webshop runt en afhankelijk bent van vindbaarheid in AI-assistenten, overweeg dan om je robots.txt-bestand te controleren. Je zou kunnen kiezen om AI-crawlers zoals die van OpenAI of Google toe te staan, zodat jouw productbeschrijvingen en reviews in AI-antwoorden kunnen verschijnen. Een optie is om een aparte allowlist te maken voor crawlers die je vertrouwt, zoals Googlebot, en andere te blokkeren. Dit kun je eenvoudig instellen via je hostingomgeving of CMS.
Als je een team aanstuurt en content produceert voor je bedrijfsblog, is het verstandig om een strategie te bepalen voor AI-toegang. Je zou kunnen besluiten om alleen crawlers toe te staan die jouw content gebruiken voor zoekmachines, maar niet voor het trainen van AI-modellen. Een mogelijkheid is om in je robots.txt een regel op te nemen die specifieke AI-crawlers blokkeert, zoals Disallow: / voor GPTBot, terwijl je andere crawlers wel toelaat. Dit geeft je controle over hoe jouw content wordt gebruikt.
Als je in de zorg of een andere gevoelige sector werkt, is het verstandig om AI-crawlers standaard te blokkeren. Je zou kunnen overwegen om alleen geautoriseerde crawlers toe te staan via een allowlist, zoals Reuters en Time doen. Een optie is om je robots.txt te updaten met regels die alle AI-crawlers uitsluiten, tenzij je expliciet toestemming geeft. Dit beschermt vertrouwelijke informatie en voorkomt dat deze in AI-antwoorden terechtkomt.
Als je een marketingbureau runt en content van nieuwssites gebruikt voor analyses, wees je ervan bewust dat bronnen zoals Reuters en Time mogelijk niet meer beschikbaar zijn in AI-tools. Je zou kunnen overwegen om alternatieve bronnen te gebruiken die AI-crawlers wel toelaten, of om directe API-toegang tot deze sites te regelen. Een mogelijkheid is om een abonnement op hun content te nemen, zodat je nog steeds toegang hebt tot hun artikelen.
Als je een tech-startup hebt die AI-tools bouwt, is het belangrijk om te weten welke sites je crawlers blokkeren. Je zou kunnen overwegen om een allowlist-systeem te implementeren, waarbij je alleen sites scrapet die expliciet toestemming geven. Een optie is om een database bij te houden van sites die AI-crawlers blokkeren, zodat je je trainingsdata kunt aanpassen. Dit helpt juridische problemen te voorkomen en verbetert de kwaliteit van je data.
Bron: Search Engine Journal (https://www.searchenginejournal.com/more-news-sites-default-to-blocking-ai-crawlers/578527/)