Przejdź do treści

Testy A/B przy małym ruchu

Przy ruchu typowym dla startupu większość testów A/B ma za małą moc statystyczną: nie wykryjesz wiarygodnie małych efektów, więc uczciwym ruchem jest testowanie tylko dużych zmian, korzystanie z metod, które potrzebują mniejszej próby, albo całkowita rezygnacja z testu. Ten poradnik pokazuje, jak rozpoznać, w której sytuacji jesteś – i co zrobić zamiast testu.

Zaktualizowano 8 min czytaniaAutor: fromHello

Najważniejsze wnioski

  1. Moc statystyczna to szansa, że test wykryje realny efekt. Mały ruch oznacza małą moc, więc wykrywalne są tylko duże różnice.

  2. Minimalny wykrywalny efekt (MDE) rośnie, gdy próba się kurczy – w skali startupu to często zmiany rzędu 20% lub więcej, a nie 2%.

  3. Metody sekwencyjne i bayesowskie zmniejszają problem wielkości próby. Nie usuwają go.

  4. Często właściwą decyzją jest rezygnacja z testu A/B: wdrożenie z metryką ochronną, większy zakład albo badania jakościowe.

Dlaczego mały ruch psuje większość testów A/B

Test A/B porównuje dwie wersje i pyta, czy różnica jest realna, czy to szum. Żeby odpowiedzieć, potrzebuje dość obserwacji, by oddzielić sygnał od przypadku, a startupy rzadko je mają. Przy kilkuset konwersjach miesięcznie matematyka mówi, że zauważysz tylko duże różnice – więc popularna rada, by testować wszystko, prowadzi do testów, które od początku nie miały szans na rozstrzygnięcie. Wybór tych kilku testów, które warto przeprowadzić, to sens mapy drogowej eksperymentów.

Moc statystyczna i MDE – prostymi słowami

Moc statystyczna to prawdopodobieństwo, że test wykryje realny efekt, jeśli on istnieje – typowy cel to 80%. Minimalny wykrywalny efekt (MDE) to najmniejsza poprawa, jaką test może wychwycić przy tej mocy, biorąc pod uwagę Twój bazowy współczynnik i wielkość próby. Obie wielkości są powiązane: mniej odwiedzających podnosi MDE. W skali startupu MDE to często względna zmiana o 20–50%, a nie 2%, które może dać kolor przycisku. Jeśli Twoja zmiana jest mniejsza niż MDE, test jej nie zobaczy w żadnym realistycznym czasie.

Przy ruchu startupu wykrywalne są tylko duże efekty – wyróżniona ćwiartka to miejsce, w którym testy A/B przy małym ruchu naprawdę działają. Małe efekty wymagają skali, której jeszcze nie masz.

Dlaczego wykrywalne są tylko duże efekty

Wymagana wielkość próby rośnie mniej więcej z odwrotnością kwadratu efektu, który chcesz wykryć, więc zmniejszenie MDE o połowę mniej więcej czterokrotnie zwiększa liczbę potrzebnych odwiedzających. Przykład obliczeniowy Optimizely podaje konkretne liczby: przy bazowym współczynniku 10% wykrycie wzrostu o 3% wymaga mniej więcej piętnastokrotnie więcej odwiedzających niż wykrycie wzrostu o 10%. Efekty, które mały zespół może uczciwie zmierzyć, to więc te wyraźne: nowa strona cennika, przebudowany onboarding, inna kluczowa oferta – a nie mikroteksty. CRO Specialist większość czasu poświęca na decydowanie, które zmiany są na tyle duże, by warto było je testować.

Testy sekwencyjne i bayesowskie pomagają – trochę

Metody sekwencyjne pozwalają zakończyć test wcześniej, gdy wynik jest rozstrzygający, a ich matematyka jest zbudowana tak, by wytrzymać wielokrotne sprawdzanie. Sekwencyjny schemat Evana Millera może ograniczyć liczbę obserwacji o 25–50%, gdy prawdziwy efekt jest duży – i istnieje właśnie po to, żeby nie podglądać testu ze stałą próbą. Podejścia bayesowskie podają prawdopodobieństwo, że jeden wariant pokonuje drugi, zamiast wartości p, co łatwiej interpretować w trakcie testu. Oba zmniejszają problem wielkości próby. Żadne go nie usuwa: jeśli prawdziwy efekt jest maleńki, każda metoda nadal potrzebuje więcej danych, niż masz.

Testuj większe zmiany i nie podglądaj wyników

Dwie zasady sprawiają, że testy przy małym ruchu pozostają uczciwe. Po pierwsze, testuj większe zmiany: wybieraj takie, które przekroczą Twój MDE, i prowadź jeden czysty test A/B zamiast testu wielowymiarowego, który jeszcze bardziej dzieli ruch. Po drugie, ustal wielkość próby i regułę zakończenia przed startem i nie ogłaszaj zwycięzcy pierwszego dnia, w którym wynik wygląda na istotny – wczesne podglądanie testu ze stałą próbą to prosta droga do tego, by szum trafił na produkcję jako sukces. Jeśli prowadzisz automatyczne podziały wewnątrz ścieżki, obowiązuje ta sama dyscyplina: z góry zapisz metrykę i horyzont. Grupa holdout – wycinek, który celowo zostawiasz przy starej wersji – to prosty sposób, by sprawdzić, czy efekt jest realny. Małe zespoły prowadzą niewiele testów, więc wybierz te, które warto przeprowadzić, i przeprowadź je porządnie.

FAQ

Najczęstsze pytania

  • Ile ruchu potrzebuję do testu A/B?

    To zależy od Twojego bazowego współczynnika konwersji i efektu, który chcesz wykryć, a nie od stałej liczby odwiedzających. Jako orientacyjny punkt odniesienia poradnik VWO podaje progi poniżej ok. 1000 odwiedzających albo 5–10 konwersji tygodniowo. Poniżej tego testuj tylko duże zmiany albo zrezygnuj z formalnych testów.

  • Czy testy sekwencyjne lub bayesowskie rozwiązują problem małego ruchu?

    Pomagają, ale go nie rozwiązują. Obie metody mogą zakończyć test szybciej, gdy efekt jest duży, ale jeśli prawdziwa różnica jest mała, każda metoda nadal potrzebuje danych, których nie masz. Zmniejszają problem wielkości próby, zamiast go usuwać.

  • Czy startup w ogóle powinien robić testy A/B?

    Czasami. Zostaw testy dla zmian na tyle dużych, by przekroczyły Twój minimalny wykrywalny efekt. Wszystko inne wdrażaj z metryką ochronną, łącz małe zmiany albo korzystaj z badań jakościowych. Testy o zbyt małej mocy marnują tygodnie i dają fałszywą pewność.

  • Czym jest podglądanie wyników i dlaczego to problem?

    Podglądanie (peeking) to wielokrotne sprawdzanie testu ze stałą próbą i zatrzymywanie go w chwili, gdy wynik wygląda na istotny. Zawyża liczbę wyników fałszywie dodatnich, bo przy dostatecznie częstym patrzeniu szum przypadkiem przekracza próg. Ustal wielkość próby i regułę zakończenia z góry albo użyj metody zbudowanej do sekwencyjnego sprawdzania.

fromHello to oprogramowanie open source do automatyzacji marketingu: wiadomości uruchamiane przez to, co robią ludzie.

fromHello Cloud udostępniamy w ramach wczesnego dostępu, przez listę oczekujących.

Wczesny dostęp

fromHello Cloud

Nikt nie zakłada firmy, żeby była mała.

Wczesny dostęp do fromHello Cloud otwieramy etapami. Onboarding prowadzimy razem z Tobą: pomagamy wszystko skonfigurować i przenieść Twoje kontakty.

Napiszemy do Ciebie, gdy otworzymy Ci dostęp. Bez spamu.

Jeszcze nie teraz? Zobacz na GitHubie