Zapier’s nieuwe AutomationBench meet of AI-modellen concrete bedrijfsprocessen kunnen uitvoeren, niet alleen maar slim kunnen praten. Dit stelt ondernemers in staat om te testen of een AI-tool hun specifieke workflow, zoals CRM-updates of klantfollow-ups, daadwerkelijk kan voltooien tot een verifieerbaar eindresultaat.

Wat er aan de hand is

Zapier, bekend van workflow-automatisering, heeft vandaag AutomationBench gelanceerd. Dit is een open benchmark die specifiek meet of AI-modellen (LLM’s) echte bedrijfsprocessen kunnen uitvoeren. Volgens Zapier richten bestaande model-evaluaties zich vooral op het beantwoorden van wiskundige vragen, het schrijven van code of logisch redeneren. Hoewel die vaardigheden belangrijk zijn, zeggen ze volgens het bedrijf weinig over het vermogen om praktisch werk te verzetten in een bedrijfscontext. AutomationBench test daarom of een AI-model taken kan voltooien zoals het vinden van de juiste CRM-records, het sturen van de juiste follow-up, het bijwerken van de juiste systemen en het bereiken van een verifieerbaar eindpunt.

Wat dit betekent

Dit betekent een verschuiving in hoe de prestaties van AI voor zakelijk gebruik worden gemeten. Voor ondernemers en professionals wordt het hiermee mogelijk om een meer praktische vraag te stellen: “Kan dit model mijn specifieke werk uitvoeren?” in plaats van “Hoe slim is dit model?”. Het maakt de keuze voor een AI-tool minder abstract. Een benchmark die focust op het voltooien van workflows – zoals het verwerken van een nieuwe lead van websiteformulier tot CRM-notificatie en welkomstmail – sluit directer aan op de dagelijkse operationele behoeften van een bedrijf. Het kan helpen om de belofte van AI-automatisering te toetsen aan de praktische realiteit.

Hoe je dit kunt toepassen

De praktische toepassing hangt af van jouw situatie. AutomationBench is een open benchmark, wat betekent dat de resultaten en methodologie publiek beschikbaar zijn. Je kunt dit gebruiken als een referentiekader bij het selecteren van AI-tools voor automatisering.

Als je een CRM-systeem gebruikt en overweegt AI in te zetten voor leadverwerking… kun je bij een leverancier navragen of hun model is getest op AutomationBench, specifiek op taken die lijken op jouw proces. Vraag niet alleen naar de algemene ‘slimheid’ van het model, maar of het bewezen heeft een volledige workflow van A tot Z te kunnen afronden.

Als je verschillende AI-automatiseringsplatformen vergelijkt… kijk dan verder dan de marketingclaims over snelheid of parameters. Zoek naar onafhankelijke of openbare benchmarkresultaten die laten zien hoe goed het platform presteert op concrete bedrijfstaken, zoals het correct routeren van data tussen apps of het maken van contextuele updates.

Als je zelf automatiseringen bouwt met AI-assistenten… gebruik dan het principe achter deze benchmark om je eigen tests op te zetten. Definieer een duidelijk, verifieerbaar eindpunt voor je workflow (bijv. “Lead staat in segment X en heeft e-mail Y ontvangen”) en test of de AI-helper consistent alle stappen correct uitvoert om daar te komen, niet alleen maar de juiste instructies begrijpt.

Overweeg om bij toekomstige AI-implementaties de nadruk te leggen op het voltooien van taken, niet alleen op het begrijpen ervan. Een tool die een proces tot een succesvol einde brengt, is vaak waardevoller dan een tool die alleen aangeeft te weten hoe het zou moeten.

Bron: Zapier