Dlaczego mały ruch psuje większość testów A/B
Test A/B porównuje dwie wersje i pyta, czy różnica jest realna, czy to szum. Żeby odpowiedzieć, potrzebuje dość obserwacji, by oddzielić sygnał od przypadku, a startupy rzadko je mają. Przy kilkuset konwersjach miesięcznie matematyka mówi, że zauważysz tylko duże różnice – więc popularna rada, by testować wszystko, prowadzi do testów, które od początku nie miały szans na rozstrzygnięcie. Wybór tych kilku testów, które warto przeprowadzić, to sens mapy drogowej eksperymentów.
Moc statystyczna i MDE – prostymi słowami
Moc statystyczna to prawdopodobieństwo, że test wykryje realny efekt, jeśli on istnieje – typowy cel to 80%. Minimalny wykrywalny efekt (MDE) to najmniejsza poprawa, jaką test może wychwycić przy tej mocy, biorąc pod uwagę Twój bazowy współczynnik i wielkość próby. Obie wielkości są powiązane: mniej odwiedzających podnosi MDE. W skali startupu MDE to często względna zmiana o 20–50%, a nie 2%, które może dać kolor przycisku. Jeśli Twoja zmiana jest mniejsza niż MDE, test jej nie zobaczy w żadnym realistycznym czasie.
Dlaczego wykrywalne są tylko duże efekty
Wymagana wielkość próby rośnie mniej więcej z odwrotnością kwadratu efektu, który chcesz wykryć, więc zmniejszenie MDE o połowę mniej więcej czterokrotnie zwiększa liczbę potrzebnych odwiedzających. Przykład obliczeniowy Optimizely podaje konkretne liczby: przy bazowym współczynniku 10% wykrycie wzrostu o 3% wymaga mniej więcej piętnastokrotnie więcej odwiedzających niż wykrycie wzrostu o 10%. Efekty, które mały zespół może uczciwie zmierzyć, to więc te wyraźne: nowa strona cennika, przebudowany onboarding, inna kluczowa oferta – a nie mikroteksty. CRO Specialist większość czasu poświęca na decydowanie, które zmiany są na tyle duże, by warto było je testować.
Testy sekwencyjne i bayesowskie pomagają – trochę
Metody sekwencyjne pozwalają zakończyć test wcześniej, gdy wynik jest rozstrzygający, a ich matematyka jest zbudowana tak, by wytrzymać wielokrotne sprawdzanie. Sekwencyjny schemat Evana Millera może ograniczyć liczbę obserwacji o 25–50%, gdy prawdziwy efekt jest duży – i istnieje właśnie po to, żeby nie podglądać testu ze stałą próbą. Podejścia bayesowskie podają prawdopodobieństwo, że jeden wariant pokonuje drugi, zamiast wartości p, co łatwiej interpretować w trakcie testu. Oba zmniejszają problem wielkości próby. Żadne go nie usuwa: jeśli prawdziwy efekt jest maleńki, każda metoda nadal potrzebuje więcej danych, niż masz.
Testuj większe zmiany i nie podglądaj wyników
Dwie zasady sprawiają, że testy przy małym ruchu pozostają uczciwe. Po pierwsze, testuj większe zmiany: wybieraj takie, które przekroczą Twój MDE, i prowadź jeden czysty test A/B zamiast testu wielowymiarowego, który jeszcze bardziej dzieli ruch. Po drugie, ustal wielkość próby i regułę zakończenia przed startem i nie ogłaszaj zwycięzcy pierwszego dnia, w którym wynik wygląda na istotny – wczesne podglądanie testu ze stałą próbą to prosta droga do tego, by szum trafił na produkcję jako sukces. Jeśli prowadzisz automatyczne podziały wewnątrz ścieżki, obowiązuje ta sama dyscyplina: z góry zapisz metrykę i horyzont. Grupa holdout – wycinek, który celowo zostawiasz przy starej wersji – to prosty sposób, by sprawdzić, czy efekt jest realny. Małe zespoły prowadzą niewiele testów, więc wybierz te, które warto przeprowadzić, i przeprowadź je porządnie.