Por que pouco tráfego quebra a maioria dos testes A/B
Um teste A/B compara duas versões e pergunta se a diferença é real ou ruído. Para responder, ele precisa de observações suficientes para separar o sinal do acaso, e as startups raramente as têm. Com algumas centenas de conversões por mês, a matemática diz que você só consegue enxergar diferenças grandes — então o conselho popular de testar tudo leva você a rodar testes que nunca iam chegar a uma conclusão. Escolher os poucos testes que valem a pena é a razão de ser de um roadmap de experimentação.
Poder estatístico e MDE em palavras simples
O poder estatístico é a probabilidade de um teste detectar um efeito real quando ele existe — 80% é a meta habitual. O efeito mínimo detectável (MDE) é a menor melhoria que um teste consegue captar com esse poder, dados a sua taxa de base e o tamanho da amostra. Os dois andam juntos: menos visitantes empurram o MDE para cima. Na escala de uma startup, o MDE costuma ser uma variação relativa de 20% a 50%, não os 2% que a cor de um botão poderia render. Se a sua mudança é menor que o seu MDE, o teste não consegue vê-la em nenhuma janela realista.
Por que só efeitos grandes são detectáveis
O tamanho de amostra necessário cresce mais ou menos com o inverso do quadrado do efeito que você quer detectar, então reduzir o MDE pela metade multiplica por cerca de quatro os visitantes de que você precisa. O próprio exemplo do Optimizely põe números nisso: com uma taxa de base de 10%, detectar um ganho de 3% exige cerca de quinze vezes os visitantes que um ganho de 10% exige. Os efeitos que uma equipe pequena consegue medir com honestidade são, portanto, os de grande porte: uma nova página de preços, um fluxo de onboarding refeito, uma oferta central diferente — não microtextos. Um CRO Specialist passa a maior parte do tempo decidindo quais mudanças são grandes o bastante para valer um teste.
Os testes sequenciais e bayesianos ajudam, um pouco
Os métodos sequenciais deixam você parar cedo quando um resultado é decisivo, com uma matemática feita para resistir a verificações repetidas. O desenho sequencial de Evan Miller pode cortar as observações em 25% a 50% quando o efeito real é grande — e existe justamente para que você não fique espiando um teste de amostra fixa. As abordagens bayesianas informam a probabilidade de uma variante superar a outra em vez de um valor-p, o que é mais fácil de interpretar com o teste em andamento. As duas reduzem o problema do tamanho da amostra. Nenhuma o elimina: se o efeito real é minúsculo, todo método ainda precisa de mais dados do que você tem.
Teste mudanças maiores e não espie o resultado
Duas regras mantêm honestos os testes com pouco tráfego. Primeiro, teste mudanças maiores: escolha variações grandes o bastante para superar o seu MDE e rode um único A/B limpo em vez de uma grade multivariada que divide ainda mais o seu tráfego. Segundo, fixe o tamanho da amostra e a regra de parada antes de começar e não declare um vencedor no primeiro dia em que o resultado parecer significativo — espiar cedo um teste de amostra fixa é o que faz o ruído ser lançado como vitória. Se você roda etapas de divisão automáticas dentro de uma jornada, vale a mesma disciplina: registre de antemão a métrica e o horizonte. Um grupo holdout — uma fatia que você mantém de propósito na experiência antiga — é uma forma simples de conferir se um efeito é real. Equipes pequenas rodam poucos testes, então escolha os que valem a pena e rode-os direito.