Steeds meer nieuwssites, waaronder Reuters en Time, blokkeren standaard AI-crawlers die hun content schrapen. Ze werken met een allowlist: alleen goedgekeurde bots krijgen toegang. Dit is een directe reactie op de groeiende stroom AI-tools die nieuwsartikelen gebruiken om modellen te trainen zonder toestemming of betaling.

Wat er aan de hand is

Reuters en Time hebben hun robots.txt-bestanden aangepast om AI-crawlers zoals die van OpenAI, Google en andere partijen standaard te blokkeren. In plaats van alles open te zetten, kiezen ze voor een allowlist: alleen crawlers die expliciet zijn goedgekeurd, mogen nog binnenkomen. Dit is een trend die breder speelt. Steeds meer grote uitgevers zetten de poorten dicht voor ongevraagde AI-scraping. Volgens Search Engine Journal is dit een verschuiving van ‘opt-out’ naar ‘opt-in’ voor AI-toegang. Waar voorheen sites moesten aangeven dat ze niet wilden worden gescrapet, draaien uitgevers het nu om: standaard is alles verboden, tenzij je toestemming geeft.

Wat dit betekent

Voor MKB-ondernemers betekent deze ontwikkeling dat de regels rond AI-scraping veranderen. Grote nieuwssites hebben de middelen en juridische teams om hun content te beschermen. Maar ook kleinere websites lopen risico. Als AI-modellen jouw content gebruiken zonder toestemming, kan dat je online zichtbaarheid beïnvloeden. Bijvoorbeeld: als een AI-tool jouw unieke productbeschrijvingen of blogs overneemt, kan dat leiden tot lagere vindbaarheid in zoekmachines, omdat dezelfde tekst elders wordt herhaald. Bovendien kan het zijn dat jouw content wordt gebruikt om concurrenten te trainen, zonder dat jij er iets voor terugkrijgt. De trend van ‘standaard blokkeren’ zet druk op kleinere partijen om ook na te denken over hun eigen AI-beleid.

Hoe je dit kunt toepassen

Als je een webshop runt met unieke productteksten, overweeg om je robots.txt-bestand aan te passen. Je kunt specifieke AI-crawlers blokkeren door regels toe te voegen zoals ‘Disallow: /’ voor bekende bots van OpenAI, Google Bard of Anthropic. Dit voorkomt dat je content wordt geschraapt zonder dat je het weet. Een mogelijkheid is om eerst te controleren welke crawlers je site bezoeken via je serverlogs of een tool zoals Cloudflare. Daarna kun je een allowlist maken voor crawlers die je wél vertrouwt, zoals die van Google voor zoekindexering.

Als je een blog of kennisbank beheert, kun je overwegen om een ‘terms of use’-pagina toe te voegen die expliciet verbiedt dat AI-tools je content gebruiken voor training. Dit is juridisch geen garantie, maar het geeft je een basis om actie te ondernemen als je merkt dat je teksten worden overgenomen. Je zou ook een simpele check kunnen doen: zoek naar zinnen uit je eigen content in AI-outputs via tools zoals Copyscape of Google zelf.

Als je een dienstverlener bent die veel unieke cases of adviezen deelt, is het slim om te inventariseren welke AI-crawlers je site bezoeken. Dit kun je doen door je serverlogs te analyseren of een plugin te gebruiken als je op WordPress zit. Vervolgens kun je besluiten om alle onbekende crawlers te blokkeren en alleen toegang te geven aan crawlers die je kent en vertrouwt. Een optie is om een aparte robots.txt te maken voor AI-crawlers, waarin je specifieke mappen zoals je blog of casestudies uitsluit.

Als je samenwerkt met andere ondernemers of brancheorganisaties, overweeg om een gezamenlijk standpunt in te nemen. Je kunt bijvoorbeeld een open brief schrijven of een petitie starten waarin je vraagt om transparantie van AI-bedrijven over welke data ze gebruiken. Dit versterkt je positie en maakt het makkelijker om collectief actie te ondernemen als je merkt dat je content wordt misbruikt.

Bron: Search Engine Journal (https://www.searchenginejournal.com/more-news-sites-default-to-blocking-ai-crawlers/578527/)