Perché con poco traffico quasi tutti i test A/B non funzionano
Un test A/B confronta due versioni e chiede se la differenza è reale o rumore. Per rispondere servono abbastanza osservazioni da separare il segnale dal caso, e le startup raramente le hanno. Con qualche centinaio di conversioni al mese, la matematica dice che puoi notare solo differenze grandi: il consiglio diffuso di testare tutto ti porta a lanciare test che non sarebbero mai arrivati a una conclusione. Scegliere i pochi test che vale la pena fare è lo scopo di una roadmap di sperimentazione.
Potenza statistica e MDE in parole semplici
La potenza statistica è la probabilità che un test rilevi un effetto reale quando c’è: l’obiettivo abituale è l’80%. L’effetto minimo rilevabile (MDE) è il miglioramento più piccolo che un test può cogliere con quella potenza, dati il tuo tasso di partenza e la dimensione del campione. I due vanno insieme: meno visitatori fanno salire l’MDE. Per una startup l’MDE è spesso una variazione relativa tra il 20% e il 50%, non il 2% che può dare il colore di un pulsante. Se la tua modifica è più piccola del tuo MDE, il test non può vederla in nessuna finestra realistica.
Perché si rilevano solo gli effetti grandi
La dimensione del campione necessaria cresce più o meno con l’inverso del quadrato dell’effetto che vuoi rilevare: dimezzare l’MDE quadruplica all’incirca i visitatori che ti servono. L’esempio di calcolo di Optimizely ci mette dei numeri: con un tasso di partenza del 10%, rilevare un aumento del 3% richiede circa quindici volte i visitatori necessari per un aumento del 10%. Gli effetti che un piccolo team può misurare onestamente sono quindi quelli macroscopici: una nuova pagina dei prezzi, un flusso di onboarding rifatto, un’offerta principale diversa, non il microcopy. Un CRO Specialist passa gran parte del tempo a decidere quali modifiche sono abbastanza grandi da meritare un test.
I test sequenziali e bayesiani aiutano, un po’
I metodi sequenziali ti permettono di fermarti prima quando un risultato è netto, con una matematica pensata per reggere controlli ripetuti. Il design sequenziale di Evan Miller può ridurre le osservazioni dal 25% al 50% quando l’effetto reale è grande, ed esiste proprio per evitare che tu sbirci un test a campione fisso. Gli approcci bayesiani riportano la probabilità che una variante batta l’altra invece di un p-value, un dato su cui è più facile ragionare a test in corso. Entrambi riducono il problema della dimensione del campione. Nessuno dei due lo elimina: se l’effetto reale è minimo, qualsiasi metodo ha comunque bisogno di più dati di quanti ne hai.
Testa cambiamenti più grandi e non sbirciare i risultati
Due regole tengono onesti i test con poco traffico. Primo, testa cambiamenti più grandi: scegli variazioni abbastanza ampie da superare il tuo MDE e fai un solo test A/B pulito invece di una griglia multivariata che divide ancora di più il traffico. Secondo, fissa la dimensione del campione e la regola di arresto prima di iniziare, e non dichiarare un vincitore il primo giorno in cui il risultato sembra significativo: sbirciare presto un test a campione fisso è il modo in cui il rumore finisce in produzione spacciato per una vittoria. Se usi split A/B automatici in un percorso, vale la stessa disciplina: registra in anticipo la metrica e l’orizzonte. Un holdout group, una quota che tieni apposta sulla vecchia esperienza, è un modo semplice per verificare che un effetto sia reale. I piccoli team fanno pochi test, quindi scegli quelli che vale la pena fare e falli bene.