Het antwoord op de vraag of een AI-tool jouw bedrijfsprocessen kan automatiseren, is tot nu toe giswerk. Met AutomationBench, een nieuwe open benchmark van Zapier, kun je nu objectief meten of een AI-model daadwerkelijk in staat is om complete werkstromen uit te voeren, zoals het bijwerken van CRM-records, het versturen van facturen of het opvolgen van klantcontact.

Wat er aan de hand is

Zapier heeft AutomationBench gelanceerd, een open benchmark die AI-modellen test op het uitvoeren van echte zakelijke workflows. Waar bestaande benchmarks vooral meten of een taalmodel wiskundige puzzels kan oplossen, code kan schrijven of logische redeneringen kan maken, kijkt AutomationBench naar wat voor ondernemers écht telt: kan het model werk gedaan krijgen. Concreet betekent dit dat de benchmark test of een AI de juiste CRM-records vindt, de juiste vervolgacties inzet, de juiste systemen bijwerkt en een controleerbaar eindresultaat oplevert. Het is een open benchmark, wat betekent dat de resultaten en methodologie publiekelijk toegankelijk zijn.

Wat dit betekent

Voor MKB-ondernemers betekent dit een einde aan het gokwerk bij het kiezen van AI-tools. Tot nu toe moest je vertrouwen op algemene scores of marketingclaims die weinig zeggen over of een model jouw specifieke processen aankan. AutomationBench maakt het mogelijk om te vergelijken welke AI-modellen daadwerkelijk in staat zijn om een reeks handelingen uit te voeren die nodig zijn in een bedrijfsomgeving. Denk aan het koppelen van een binnenkomende e-mail aan een klantdossier, het genereren van een offerte en het bijwerken van de voorraadadministratie. Dit is een verschuiving van ‘wat kan een AI weten?’ naar ‘wat kan een AI doen?’.

Hoe je dit kunt toepassen

Als je een webshop runt en je wilt klantbestellingen automatiseren, kun je AutomationBench gebruiken om te beoordelen of een AI-model in staat is om een bestelling uit een e-mail te halen, de voorraad in je systeem te checken, een factuur aan te maken en de klant een bevestiging te sturen. Je zou kunnen kijken naar de scores van modellen op workflows die lijken op jouw orderproces. Een mogelijkheid is om de open resultaten te raadplegen om te zien welk model het beste presteert op taken met meerdere stappen en systeemkoppelingen.

Als je een team aanstuurt en je wilt de opvolging van leads automatiseren, overweeg dan om te controleren of een AI-model in de benchmark goed scoort op workflows die beginnen met een binnenkomend contactformulier, vervolgens een nieuw contact aanmaken in je CRM, een opvolgtaak plannen en een gepersonaliseerde e-mail versturen. De benchmark laat zien of een model deze keten van acties foutloos kan doorlopen, wat je een indicatie geeft van de betrouwbaarheid voor jouw verkooppijplijn.

Als je in de dienstverlening werkt en je wilt facturatie stroomlijnen, kun je de benchmarkresultaten gebruiken om te bepalen welk model het beste is in het verwerken van gewerkte uren, het genereren van een factuur op basis van een uurtarief en het bijwerken van een boekhoudpakket. Een optie is om de prestaties van verschillende modellen op dit type gestructureerde, data-gedreven workflow te vergelijken. De praktische toepassing hangt af van jouw situatie, maar de benchmark biedt een objectieve basis om een keuze te maken.

Bron: Zapier (https://zapier.com/blog/introducing-automationbench)