Het antwoord: Zapier heeft een eigen benchmark ontwikkeld, AutomationBench, om te testen hoe goed AI-modellen multi-step workflows uitvoeren. Dit helpt jou te bepalen welk model het beste past bij jouw specifieke automatiseringen, zoals klantenservice, facturatie of marketing.
Wat er aan de hand is
Zapier, het platform voor automatisering zonder code, heeft een overzicht gepubliceerd van alle AI-modellen die je in je Zaps kunt gebruiken. Het bedrijf test elk model met AutomationBench, een eigen benchmark die meet hoe goed een model taken in meerdere stappen uitvoert, niet alleen losse prompts. Dit is relevant omdat AI-modellen wekelijks worden gelanceerd en het lastig is bij te houden welk model voor welke workflow geschikt is. Het overzicht van Zapier fungeert als een levende referentie, die continu wordt bijgewerkt met nieuwe modellen van providers zoals OpenAI, Google, Anthropic en anderen.
Wat dit betekent
Voor ondernemers betekent dit dat je niet meer blind hoeft te kiezen tussen modellen zoals GPT-4, Gemini of Claude. De AutomationBench-resultaten geven inzicht in hoe een model presteert in praktijksituaties, zoals het verwerken van een klantvraag, het genereren van een factuur of het opstellen van een marketingmail. Dit is vooral nuttig voor MKB-bedrijven die meerdere stappen in één workflow willen automatiseren, zoals het ophalen van data uit een formulier, het genereren van een antwoord en het opslaan in een CRM. Zonder deze informatie zou je kunnen kiezen voor een model dat wel goed is in tekstgeneratie, maar slecht in het uitvoeren van sequentiële taken.
Hoe je dit kunt toepassen
Als je een webshop runt en klantenservice automatiseert, overweeg om een model te kiezen dat hoog scoort op AutomationBench voor multi-step taken. Stel dat je een Zap hebt die een e-mail van een klant leest, de vraag categoriseert, een antwoord genereert en dat opslaat in je helpdesk. Een model dat goed is in losse prompts kan hier vastlopen, terwijl een model dat getraind is op sequentiële logica soepeler werkt. Je zou kunnen beginnen met het testen van GPT-4 of Claude in een test-Zap voordat je het uitrolt.
Als je een team aanstuurt en marketingworkflows automatiseert, kun je modellen vergelijken op basis van hoe ze omgaan met gestructureerde data. Denk aan een Zap die leads uit een formulier haalt, een gepersonaliseerde e-mail schrijft en de lead in een CRM bijwerkt. Een model dat goed presteert in AutomationBench kan hier consistenter zijn. Een optie is om Gemini 3.5 Flash te proberen, omdat dit model is ontworpen voor snelle, gestructureerde taken.
Als je in de financiële administratie werkt en facturatie automatiseert, is het belangrijk dat het model nauwkeurig getallen verwerkt en stappen in de juiste volgorde uitvoert. Stel dat je een Zap hebt die een inkooporder ontvangt, een factuur genereert en deze naar de boekhouding stuurt. Een model dat hoog scoort op AutomationBench kan hier fouten voorkomen. Overweeg om een model te kiezen dat specifiek is getest op dataverwerking, zoals Opus 4.8 van Anthropic.
Als je een klein team hebt en snel wilt schakelen tussen verschillende workflows, kun je de AutomationBench-resultaten gebruiken om één model te kiezen dat breed inzetbaar is. In plaats van per workflow een apart model te selecteren, kun je een model kiezen dat consistent presteert in meerdere scenario’s. Een mogelijkheid is om te starten met een model dat door Zapier wordt aanbevolen voor algemene automatisering, zoals GPT-4, en dit te testen in een paar veelgebruikte Zaps.
Bron: Zapier (https://zapier.com/blog/ai-models-on-zapier)