Vai al contenuto

Test A/B con poco traffico

Con il traffico di una startup, quasi tutti i test A/B hanno una potenza statistica insufficiente: non riesci a rilevare in modo affidabile gli effetti piccoli. La scelta onesta è testare solo grandi cambiamenti, usare metodi che richiedono meno campioni o rinunciare del tutto al test. Questa guida spiega come capire in quale situazione ti trovi e cosa fare invece.

Aggiornato: 8 min di letturaDi fromHello

Punti chiave

  1. La potenza statistica è la probabilità che un test rilevi un effetto reale. Poco traffico significa poca potenza, quindi si rilevano solo differenze grandi.

  2. L’effetto minimo rilevabile (MDE) cresce quando il campione si riduce: per una startup spesso significa variazioni del 20% o più, non del 2%.

  3. I metodi sequenziali e bayesiani riducono il problema della dimensione del campione. Non lo eliminano.

  4. Spesso la scelta giusta è non fare un test A/B: rilascia con una metrica di salvaguardia, punta su un cambiamento più grande o passa alla ricerca qualitativa.

Perché con poco traffico quasi tutti i test A/B non funzionano

Un test A/B confronta due versioni e chiede se la differenza è reale o rumore. Per rispondere servono abbastanza osservazioni da separare il segnale dal caso, e le startup raramente le hanno. Con qualche centinaio di conversioni al mese, la matematica dice che puoi notare solo differenze grandi: il consiglio diffuso di testare tutto ti porta a lanciare test che non sarebbero mai arrivati a una conclusione. Scegliere i pochi test che vale la pena fare è lo scopo di una roadmap di sperimentazione.

Potenza statistica e MDE in parole semplici

La potenza statistica è la probabilità che un test rilevi un effetto reale quando c’è: l’obiettivo abituale è l’80%. L’effetto minimo rilevabile (MDE) è il miglioramento più piccolo che un test può cogliere con quella potenza, dati il tuo tasso di partenza e la dimensione del campione. I due vanno insieme: meno visitatori fanno salire l’MDE. Per una startup l’MDE è spesso una variazione relativa tra il 20% e il 50%, non il 2% che può dare il colore di un pulsante. Se la tua modifica è più piccola del tuo MDE, il test non può vederla in nessuna finestra realistica.

Con il traffico di una startup si rilevano solo gli effetti grandi: il quadrante evidenziato è quello in cui i test A/B con poco traffico funzionano davvero. Gli effetti piccoli richiedono volumi che ancora non hai.

Perché si rilevano solo gli effetti grandi

La dimensione del campione necessaria cresce più o meno con l’inverso del quadrato dell’effetto che vuoi rilevare: dimezzare l’MDE quadruplica all’incirca i visitatori che ti servono. L’esempio di calcolo di Optimizely ci mette dei numeri: con un tasso di partenza del 10%, rilevare un aumento del 3% richiede circa quindici volte i visitatori necessari per un aumento del 10%. Gli effetti che un piccolo team può misurare onestamente sono quindi quelli macroscopici: una nuova pagina dei prezzi, un flusso di onboarding rifatto, un’offerta principale diversa, non il microcopy. Un CRO Specialist passa gran parte del tempo a decidere quali modifiche sono abbastanza grandi da meritare un test.

I test sequenziali e bayesiani aiutano, un po’

I metodi sequenziali ti permettono di fermarti prima quando un risultato è netto, con una matematica pensata per reggere controlli ripetuti. Il design sequenziale di Evan Miller può ridurre le osservazioni dal 25% al 50% quando l’effetto reale è grande, ed esiste proprio per evitare che tu sbirci un test a campione fisso. Gli approcci bayesiani riportano la probabilità che una variante batta l’altra invece di un p-value, un dato su cui è più facile ragionare a test in corso. Entrambi riducono il problema della dimensione del campione. Nessuno dei due lo elimina: se l’effetto reale è minimo, qualsiasi metodo ha comunque bisogno di più dati di quanti ne hai.

Testa cambiamenti più grandi e non sbirciare i risultati

Due regole tengono onesti i test con poco traffico. Primo, testa cambiamenti più grandi: scegli variazioni abbastanza ampie da superare il tuo MDE e fai un solo test A/B pulito invece di una griglia multivariata che divide ancora di più il traffico. Secondo, fissa la dimensione del campione e la regola di arresto prima di iniziare, e non dichiarare un vincitore il primo giorno in cui il risultato sembra significativo: sbirciare presto un test a campione fisso è il modo in cui il rumore finisce in produzione spacciato per una vittoria. Se usi split A/B automatici in un percorso, vale la stessa disciplina: registra in anticipo la metrica e l’orizzonte. Un holdout group, una quota che tieni apposta sulla vecchia esperienza, è un modo semplice per verificare che un effetto sia reale. I piccoli team fanno pochi test, quindi scegli quelli che vale la pena fare e falli bene.

FAQ

Domande frequenti

  • Quanto traffico serve per fare un test A/B?

    Dipende dal tuo tasso di conversione di partenza e dall’effetto che vuoi rilevare, non da un numero fisso di visitatori. Come riferimento indicativo, la guida di VWO cita soglie approssimative di meno di circa 1.000 visitatori o 5–10 conversioni a settimana. Sotto queste soglie, metti in conto di testare solo grandi cambiamenti o di rinunciare ai test formali.

  • I test sequenziali o bayesiani risolvono il problema del poco traffico?

    Aiutano, ma non lo risolvono. Entrambi possono chiudere un test prima quando l’effetto è grande, ma se la differenza reale è piccola qualsiasi metodo ha comunque bisogno di dati che non hai. Riducono il problema della dimensione del campione, non lo eliminano.

  • Una startup dovrebbe fare test A/B?

    A volte. Riserva i test alle modifiche abbastanza grandi da superare il tuo effetto minimo rilevabile. Per tutto il resto, rilascia con una metrica di salvaguardia, raggruppa le piccole modifiche o usa la ricerca qualitativa. I test con potenza insufficiente fanno perdere settimane e danno una falsa sicurezza.

  • Cos’è il peeking e perché è un problema?

    Il peeking consiste nel controllare più volte un test a campione fisso e fermarlo appena sembra significativo. Gonfia i falsi positivi, perché il rumore supera la soglia per caso se guardi abbastanza spesso. Fissa in anticipo la dimensione del campione e la regola di arresto, oppure usa un metodo pensato per controlli sequenziali.

fromHello è un software di marketing automation open source: messaggi attivati da ciò che fanno le persone.

fromHello Cloud è in accesso anticipato tramite la lista d’attesa.

Accesso anticipato

fromHello Cloud

Non si parte per restare piccoli.

L’accesso anticipato a fromHello Cloud si apre a scaglioni. L’onboarding è guidato: ti aiutiamo a configurare tutto e a portare i tuoi contatti.

Ti scriveremo quando il tuo accesso sarà pronto. Niente spam.

Vuoi aspettare ancora un po’? Vedi su GitHub