Waarom de meeste A/B-tests stuklopen op weinig verkeer
Een A/B-test vergelijkt twee versies en vraagt of het verschil echt is of ruis. Om dat te beantwoorden, heeft hij genoeg waarnemingen nodig om signaal van toeval te scheiden, en die hebben start-ups zelden. Met een paar honderd conversies per maand zegt de rekensom dat je alleen grote verschillen kunt zien – dus het populaire advies om alles te testen, laat je tests draaien die nooit tot een conclusie hadden kunnen komen. De paar tests kiezen die het waard zijn, is precies waar een experimentenroadmap voor dient.
Statistische power en MDE in gewone woorden
Statistische power is de kans dat een test een echt effect ziet als dat er is – 80% is het gebruikelijke doel. Het minimum detectable effect (MDE) is de kleinste verbetering die een test bij die power kan oppikken, gegeven je basisconversie en je steekproefgrootte. De twee bewegen samen: minder bezoekers duwen het MDE omhoog. Voor een start-up is het MDE vaak een relatief verschil van 20% tot 50%, niet de 2% die een knopkleur zou kunnen opleveren. Is je wijziging kleiner dan je MDE, dan kan de test haar binnen geen enkele realistische termijn zien.
Waarom alleen grote effecten meetbaar zijn
De benodigde steekproef schaalt ruwweg met het omgekeerde kwadraat van het effect dat je wilt meten, dus een half zo groot MDE vraagt ongeveer vier keer zoveel bezoekers. Het eigen rekenvoorbeeld van Optimizely maakt het concreet: bij een basisconversie van 10% heb je voor een stijging van 3% ongeveer vijftien keer zoveel bezoekers nodig als voor een stijging van 10%. De effecten die een klein team eerlijk kan meten, zijn dus de grove: een nieuwe prijspagina, een herziene onboardingflow, een ander kernaanbod – geen microcopy. Een CRO Specialist besteedt het grootste deel van de tijd aan bepalen welke wijzigingen groot genoeg zijn om een test waard te zijn.
Sequentieel en bayesiaans testen helpen, een beetje
Met sequentiële methoden mag je vroeg stoppen als een resultaat beslissend is, met een rekenmodel dat bestand is tegen herhaald kijken. Het sequentiële ontwerp van Evan Miller kan het aantal waarnemingen met 25% tot 50% verminderen als het echte effect groot is – en het bestaat juist zodat je niet tussentijds gaat gluren bij een test met een vaste steekproef. Bayesiaanse methoden geven de kans dat de ene variant de andere verslaat in plaats van een p-waarde, en daar valt halverwege makkelijker mee te redeneren. Beide verkleinen het probleem van de steekproefgrootte. Geen van beide neemt het weg: is het echte effect klein, dan heeft elke methode nog steeds meer data nodig dan je hebt.
Test grotere wijzigingen en pas op voor gluren
Twee regels houden testen met weinig verkeer eerlijk. Ten eerste: test grotere wijzigingen. Kies stappen die groot genoeg zijn om boven je MDE uit te komen, en draai één zuivere A/B-test in plaats van een multivariaat raster dat je verkeer nog verder opsplitst. Ten tweede: leg de steekproefgrootte en de stopregel vast voordat je begint, en roep geen winnaar uit op de eerste dag dat het significant lijkt – door vroeg te gluren bij een test met een vaste steekproef gaat ruis als winst live. Gebruik je geautomatiseerde splitstappen in een journey, dan geldt dezelfde discipline: leg de metric en de horizon vooraf vast. Een holdoutgroep – een deel dat je bewust op de oude ervaring houdt – is een eenvoudige manier om te controleren of een effect echt is. Kleine teams draaien weinig tests, dus kies de tests die het waard zijn en voer ze goed uit.