Warum wenig Traffic die meisten A/B-Tests scheitern lässt
Ein A/B-Test vergleicht zwei Versionen und fragt, ob der Unterschied echt ist oder Rauschen. Um das zu beantworten, braucht er genug Beobachtungen, um Signal von Zufall zu trennen, und die haben Startups selten. Bei ein paar hundert Conversions im Monat sagt die Mathematik, dass Sie nur große Unterschiede erkennen können – der beliebte Rat, alles zu testen, führt Sie also in Tests, die nie zu einem Ergebnis kommen konnten. Die wenigen Tests auszuwählen, die sich lohnen, ist der Sinn einer Experiment-Roadmap.
Statistische Power und MDE, einfach erklärt
Statistische Power ist die Wahrscheinlichkeit, dass ein Test einen echten Effekt erkennt, wenn es einen gibt – üblich sind 80 % als Ziel. Der minimal nachweisbare Effekt (MDE) ist die kleinste Verbesserung, die ein Test bei dieser Power erfassen kann, abhängig von Ihrer Basisrate und Stichprobengröße. Beide hängen zusammen: Weniger Besucher treiben den MDE nach oben. Bei Startup-Größe liegt der MDE oft bei einer relativen Änderung von 20 % bis 50 %, nicht bei den 2 %, die eine Buttonfarbe vielleicht bringt. Ist Ihre Änderung kleiner als Ihr MDE, kann der Test sie in keinem realistischen Zeitraum sehen.
Warum nur große Effekte erkennbar sind
Die nötige Stichprobengröße verhält sich ungefähr umgekehrt proportional zum Quadrat des Effekts, den Sie erkennen wollen. Den MDE zu halbieren, vervierfacht also ungefähr die Zahl der Besucher, die Sie brauchen. Das Rechenbeispiel von Optimizely selbst beziffert das: Bei einer Basisrate von 10 % braucht der Nachweis einer Steigerung um 3 % etwa fünfzehnmal so viele Besucher wie eine Steigerung um 10 %. Die Effekte, die ein kleines Team ehrlich messen kann, sind deshalb die groben: eine neue Preisseite, ein überarbeiteter Onboarding-Ablauf, ein anderes Kernangebot – nicht Microcopy. Ein CRO Specialist verbringt die meiste Zeit damit, zu entscheiden, welche Änderungen groß genug für einen Test sind.
Sequenzielle und bayessche Tests helfen, ein wenig
Sequenzielle Methoden erlauben es, früh aufzuhören, wenn ein Ergebnis eindeutig ist, und ihre Mathematik ist so gebaut, dass sie wiederholte Prüfungen übersteht. Das sequenzielle Design von Evan Miller kann die nötigen Beobachtungen um 25 % bis 50 % senken, wenn der wahre Effekt groß ist – und es existiert genau deshalb, damit Sie nicht vorzeitig in einen Test mit fester Stichprobe hineinschauen. Bayessche Ansätze geben die Wahrscheinlichkeit an, dass eine Variante eine andere schlägt, statt eines p-Werts, und darüber lässt sich während des Laufs leichter nachdenken. Beide verkleinern das Stichprobenproblem. Keine beseitigt es: Ist der wahre Effekt winzig, braucht jede Methode immer noch mehr Daten, als Sie haben.
Größere Änderungen testen und sich vor Peeking schützen
Zwei Regeln halten Tests bei wenig Traffic ehrlich. Erstens: Testen Sie größere Änderungen. Wählen Sie Änderungen, die groß genug sind, um Ihren MDE zu übersteigen, und fahren Sie lieber einen sauberen A/B-Test als ein multivariates Raster, das Ihren Traffic weiter aufteilt. Zweitens: Legen Sie Stichprobengröße und Abbruchregel fest, bevor Sie starten, und erklären Sie keinen Gewinner am ersten Tag, an dem es signifikant aussieht – frühes Peeking bei einem Test mit fester Stichprobe ist genau der Weg, auf dem Rauschen als Erfolg live geht. Wenn Sie automatisierte Split-Schritte in einer Journey fahren, gilt dieselbe Disziplin: Legen Sie Kennzahl und Zeithorizont vorab fest. Eine Holdout-Gruppe – ein Teil, den Sie bewusst bei der alten Version belassen – ist ein einfacher Weg, zu prüfen, ob ein Effekt echt ist. Kleine Teams fahren wenige Tests, also wählen Sie die, die sich lohnen, und fahren Sie sie richtig.