AI-scribes die gesprekken samenvatten, hallucineren structureel. Uit een Canadese overheidsaudit bleek dat alle twintig geteste AI-systemen fouten maakten, variërend van verzonnen verwijzingen tot onjuiste medicijnnamen. Dit probleem beperkt zich niet tot de zorg: elk bedrijf dat AI gebruikt voor het samenvatten van klantgesprekken, notulen of administratie loopt hetzelfde risico.
Wat er aan de hand is
De auditor-generaal van de Canadese provincie Ontario onderzocht AI-scribes die door de overheid waren goedgekeurd voor gebruik door zorgverleners. Het rapport, gepubliceerd in mei 2026, beschrijft hoe twintig verschillende AI-vendors werden getest met twee gesimuleerde doktersgesprekken. Geen enkele vendor scoorde foutloos. Negen systemen verzonnen patiëntinformatie, twaalf noteerden informatie onjuist en zeventien misten belangrijke details over besproken mentale gezondheidsproblemen. Concreet hallucineerden AI-scribes niet-bestaande verwijzingen voor bloedtesten of therapie, schreven ze medicijnnamen verkeerd en misten ze cruciale informatie uit gesprekken.
Wat dit betekent
De audit toont aan dat AI-hallucinaties geen randverschijnsel zijn, maar een structureel probleem in systemen die gesproken taal samenvatten. Voor ondernemers betekent dit dat elke AI-toepassing die klantgesprekken, notulen of rapportages automatisch genereert, actief gecontroleerd moet worden. Het risico is niet alleen reputatieschade, maar ook juridische aansprakelijkheid als foutieve informatie in contracten, offertes of dossiers terechtkomt. De audit bevestigt wat veel gebruikers al vermoedden: AI is een hulpmiddel, geen vervanging voor menselijke controle.
Hoe je dit kunt toepassen
Als je AI gebruikt om klantgesprekken samen te vatten. Je zou kunnen overwegen om een steekproefsgewijze controle in te bouwen. Laat een medewerker wekelijks vijf willekeurige AI-samenvattingen vergelijken met de originele opname of aantekeningen. Noteer welke fouten structureel terugkomen, zoals verzonnen afspraken of verkeerd begrepen data. Een mogelijkheid is om een eenvoudige checklist te maken met de meest voorkomende hallucinaties in jouw sector, zodat controleurs weten waar ze op moeten letten.
Als je AI inzet voor interne notulen of rapportages. Overweeg om een tweede lezer in te stellen voor documenten die extern worden gedeeld. De audit toont aan dat AI-systemen zelfs bij eenvoudige gesprekken informatie verzinnen. Een optie is om notulen altijd te markeren als ‘gegenereerd met AI, niet geverifieerd’ totdat een mens ze heeft gecontroleerd. Je zou ook kunnen experimenteren met een korte, verplichte wachttijd tussen het genereren en het versturen van AI-teksten, zodat er ruimte is voor controle.
Als je een team aanstuurt dat met AI werkt. Het is verstandig om je medewerkers te trainen in het herkennen van hallucinaties. De audit laat zien dat zelfs goedgekeurde systemen fouten maken. Een mogelijkheid is om een korte workshop te organiseren waarin je samen met je team voorbeelden van hallucinaties uit jullie eigen AI-tools bespreekt. Je zou kunnen afspreken dat iedereen die een fout ontdekt, deze meldt in een gedeeld document, zodat het team leert welke fouten het vaakst voorkomen.
Als je overweegt AI aan te schaffen voor administratieve processen. Vraag bij leveranciers altijd naar onafhankelijke tests van hun systeem. De Canadese audit bewijst dat eigen claims van vendors niet voldoende zijn. Een optie is om een proefperiode van een maand af te spreken waarin je zelf minimaal tien gesprekken door het systeem laat verwerken en de uitkomsten controleert. Overweeg om in de proefperiode bewust lastige situaties voor te leggen, zoals gesprekken met cijfers, data of specifieke vaktaal.
Bron: Arstechnica (https://arstechnica.com/health/2026/05/your-doctors-ai-notetaker-may-be-making-things-up-ontario-audit-finds/)