Seu teste A/B pode estar te enganando
Encerrar o teste quando o resultado parece bom quase quadruplica os falsos positivos. Simulamos 10.000 testes A/B para mostrar o efeito do peeking.
Encerrar um teste A/B na hora em que o resultado “parece bom” tem nome: peeking. A prática parece inofensiva, mas quebra as garantias estatísticas do experimento. Em uma simulação com 10.000 testes, ela levou a taxa de falsos positivos de 5% para quase 20%.
Testes A/B são amplamente utilizados para comparar populações independentes, e a lógica parece simples: medir se há diferença estatisticamente significativa em uma métrica entre dois grupos, A e B. No marketing digital, o uso mais comum é decidir qual criativo apresenta melhor desempenho em determinada métrica (como taxa de clique) e, com base nisso, direcionar o investimento apenas para a versão mais promissora. Só que dois detalhes da estatística por trás do teste costumam passar despercebidos. Este artigo mostra os dois, com números.
- Como funciona o teste A/B frequentista
- O que o teste realmente responde
- Peeking: o erro de espiar o resultado
- A simulação: o salto dos falsos positivos
- Como testar sem cair na armadilha
Como funciona o teste A/B frequentista
Vamos a um exemplo com dois anúncios:
- Versão A: a base
- Versão B: idêntica à A, mas com o botão vermelho
No teste A/B frequentista, o processo geralmente segue três etapas:
- A audiência é dividida aleatoriamente entre os dois grupos.
- Medem-se impressões e cliques para cada versão.
- Com base nos dados, avalia-se se é possível rejeitar a hipótese de que A e B possuem a mesma taxa de clique, adotando, por exemplo, um nível de confiança de 95%.
O passo a passo de montagem, medição e leitura de um experimento está no nosso artigo sobre teste A/B na prática. Aqui, o foco é outro: o que o resultado significa de fato e como ele pode enganar.
O que o teste realmente responde
Aqui cabe um ponto importante: o teste não responde diretamente à pergunta “qual anúncio é melhor”. O que ele responde é mais sutil e menos interessante.
O teste parte da hipótese de que não há diferença real entre os dois anúncios. É a chamada hipótese nula:
H0: pA = pB
Nela, pA e pB são as taxas de clique reais das versões A e B. Assumindo essa hipótese, o teste calcula quão improvável seria observarmos a diferença que estamos vendo nos dados apenas por uma variação aleatória. Se o resultado observado for improvável o bastante sob H0 (probabilidade menor que 5%, por exemplo), dizemos que ele é estatisticamente significativo.
Repare no que isso implica: o nível de confiança de 95% já aceita, por construção, 5% de falsos positivos. Em 1 a cada 20 testes de anúncios idênticos, esperamos declarar um vencedor que não existe. Esse é o preço combinado. O problema é quando o processo de decisão infla esse preço sem ninguém perceber.
Peeking: o erro de espiar o resultado
Agora vem o segundo problema, e talvez o mais grave. É comum ver times acompanhando os resultados ao longo do experimento e decidindo encerrar o teste quando o resultado “parece bom”. Essa prática, apesar de intuitiva, quebra as garantias estatísticas do teste e eleva drasticamente o risco de falsos positivos.
O motivo: a garantia dos 5% vale para uma única análise, feita sobre uma amostra definida antes do início. Quando o time espia várias vezes e para o teste na primeira espiada favorável, cada espiada vira uma nova chance de o acaso cruzar a linha da significância. A diferença entre os grupos oscila ao longo do experimento por pura variação amostral, e parar no pico da oscilação é selecionar o ruído, não o sinal.
A simulação: o salto dos falsos positivos
Simulamos esse cenário para visualizar o impacto real:
- Foram rodados 10.000 testes com anúncios A e B idênticos, ambos com taxa real de clique de 10%.
- Cada teste foi “espiado” 10 vezes antes de ser finalizado.
- Resultado: a taxa de falsos positivos saltou de 5% (o valor esperado) para quase 20%.
Ou seja, mesmo sem qualquer diferença real entre os grupos, o teste indicou superioridade de uma das versões em quase 20% das vezes. Na prática, isso aumenta consideravelmente o risco de decisões erradas baseadas apenas em variações aleatórias dos dados: verba realocada, criativo pausado e “aprendizado” registrado sobre um efeito que nunca existiu.
O código da simulação está em um notebook público no Colab, para quem quiser reproduzir os números ou variar os parâmetros.
Como testar sem cair na armadilha
Dentro do arcabouço frequentista, a proteção é disciplina: calcular o tamanho da amostra antes de começar, rodar o teste até atingir esse tamanho e só então olhar a significância. Espiar no meio, sem correção estatística, invalida a conta.
Na Marktech, utilizamos métodos mais flexíveis para testes A/B, que permitem análise contínua dos resultados sem comprometer a validade matemática do experimento. Eles também oferecem respostas mais diretas à pergunta prática que interessa: qual anúncio tem maior probabilidade de ser superior?
O mesmo rigor que protege um teste de criativo vale para decisões maiores de mídia, como estimar o efeito de cada canal no resultado: é o tema do nosso artigo sobre Marketing Mix Modeling com o Meridian.
Antes de encerrar o próximo teste, vale se perguntar: a amostra foi definida antes do início? Quantas vezes o resultado já foi espiado? E, olhando para trás, você já caiu nessa armadilha?
Quer esses resultados nas suas campanhas?
Fale com um consultor da Marktech e receba um diagnóstico gratuito da sua operação de mídia.
Falar com consultor