Het antwoord Zapier heeft een eigen benchmark ontwikkeld, AutomationBench, om te testen hoe goed AI-modellen presteren in meerstaps-workflows, niet alleen in statische prompts. Dit helpt ondernemers te bepalen welk model het beste past bij specifieke taken zoals klantenservice of facturatie, zonder dat ze zelf uitgebreid hoeven te testen.
Wat er aan de hand is Zapier, het platform voor automatisering tussen apps, heeft een overzicht gepubliceerd van alle AI-modellen die je kunt gebruiken in Zaps en Agents. Het bedrijf test elk model via AutomationBench, een eigen benchmark die meet hoe goed een model meerstaps-workflows uitvoert. Dit is anders dan traditionele benchmarks, die vaak alleen naar losse prompts kijken. Het overzicht wordt beschouwd als een levende referentie, omdat er wekelijks nieuwe modellen bijkomen. De focus ligt op modellen van grote aanbieders zoals OpenAI, Anthropic en Google, die je direct kunt koppelen aan je Zapier-automatiseringen.
Wat dit betekent Voor MKB-ondernemers betekent dit dat je niet meer blindelings hoeft te kiezen tussen AI-modellen. Waar je eerder afging op algemene prestaties of marketingclaims, geeft Zapier nu een praktische indicatie van hoe een model presteert in echte workflows. Denk aan het automatisch verwerken van facturen, het beantwoorden van klantvragen of het genereren van rapportages. Dit is vooral relevant voor bedrijven die meerdere stappen automatiseren, zoals het ophalen van data uit een e-mail, het samenvatten ervan en het wegschrijven naar een CRM. Een model dat goed scoort in een statische test kan juist falen in zo’n keten. De AutomationBench-resultaten helpen om die valkuil te vermijden.
Hoe je dit kunt toepassen Als je een webshop runt en klantvragen automatisch wilt beantwoorden, overweeg om een model te kiezen dat hoog scoort op meerstaps-workflows in AutomationBench. Je kunt een Zap maken die een binnenkomende e-mail parseert, de vraag categoriseert, een antwoord genereert en dat in je helpdesk-systeem zet. Test eerst met een model dat goed presteert in de benchmark voordat je het uitrolt.
Als je facturatieprocessen automatiseert, bijvoorbeeld het verwerken van inkomende facturen uit e-mailbijlagen, dan is een model met sterke prestaties in data-extractie en logische stappen geschikt. Je zou een Zap kunnen opzetten die de bijlage downloadt, de belangrijkste velden (factuurnummer, bedrag, datum) uitleest en deze in je boekhoudsoftware zet. Kijk in de AutomationBench-resultaten welk model hier het beste in is.
Als je een team aanstuurt en rapportages genereert uit meerdere bronnen, zoals verkoopcijfers uit een CRM en marketingdata uit een analytics-tool, dan kun je een model inzetten dat deze data combineert en samenvat. Een mogelijke workflow is: data ophalen uit twee apps, deze laten samenvatten door het AI-model, en de samenvatting naar een Slack-kanaal sturen. De keuze van het model hangt af van hoe goed het meerstaps-taken aankan, wat je terugziet in de benchmark.
Als je in de zorg werkt en patiëntinformatie uit verschillende systemen moet bundelen, kun je een Zap maken die gegevens uit een afsprakenmodule en een EPD haalt, deze door een AI-model laat structureren en in een overzicht zet. AutomationBench helpt je te kiezen welk model betrouwbaar is in het volgen van meerdere stappen zonder fouten.
Als je een freelance ondernemer bent en je facturatie en projectbeheer automatiseert, overweeg dan om een model te gebruiken dat goed is in het herkennen van context en het uitvoeren van opeenvolgende acties. Je zou een Zap kunnen maken die een nieuwe projecttaak in Trello aanmaakt op basis van een e-mail, de uren bijhoudt in Toggl en aan het einde van de maand een factuur genereert. De AutomationBench-resultaten geven aan welk model dit soort ketens soepel doorloopt.
Bron: Zapier