Pular para o conteúdo
  1. Home
  2. ›
  3. Growth Hacking
  4. ›
  5. Teste A/B com pouco tráfego
Growth Hacking

Teste A/B com pouco tráfego: as alternativas honestas

Rodar um A/B subdimensionado e parar quando a variante preferida está na frente não é experimento — é observar ruído e escolher a interpretação favorável. Existem saídas melhores.

Cleber Barbosa
13 min de leitura
2.564 palavras
Teste A/B com pouco tráfego: as alternativas honestas — capa do artigo
Capa: MarketingABM

Existe uma conversa que se repete em toda operação B2B que tenta fazer experimentação a sério. Alguém propõe um teste A/B, alguém pergunta quanto tempo ele levaria, e a resposta é: com o tráfego atual, quatro anos.

A reação comum é ignorar a matemática e rodar mesmo assim. Duas semanas depois, a variante B está na frente, o time declara vitória e implementa. Isso não é experimento — é observar ruído e escolher a interpretação favorável.

O custo real dessa prática não é o teste perdido. É que o time passa a acreditar em um aprendizado falso e a aplicá-lo em outros lugares, multiplicando o erro.

Este artigo é sobre o que fazer quando o volume não dá, sem abrir mão do rigor e sem parar de experimentar.

Por que a matemática não perdoa

Vale entender o mecanismo, porque ele explica todas as alternativas.

Um teste A/B tenta distinguir efeito real de variação aleatória. O problema é que taxas de conversão oscilam naturalmente — se você dividir o mesmo tráfego em dois grupos idênticos, sem mudar nada, os números vão diferir. Essa diferença espúria pode facilmente chegar a vários pontos percentuais em amostras pequenas.

Para ter confiança de que uma diferença observada é real, você precisa de amostra suficiente para que o ruído fique menor que o efeito. E aqui está a parte cruel: a amostra necessária cresce muito mais rápido do que o efeito diminui.

Detectar uma melhora grande — dobrar a conversão, por exemplo — exige relativamente pouco. Detectar uma melhora de 5% sobre uma taxa baixa exige um volume que a maioria dos sites B2B não vê em anos.

A conta rápida

Antes de propor um teste, faça a estimativa: quantas conversões por variante você teria no período disponível? Se for menos de algumas centenas, um A/B tradicional não vai produzir resultado confiável — e é melhor descobrir isso antes de gastar duas semanas.

Os três erros que produzem falsa certeza

Antes das alternativas, vale nomear o que não fazer, porque são práticas comuns e que passam despercebidas.

Parar quando o resultado agrada

É o erro mais frequente. O time acompanha o painel diariamente e encerra o teste no dia em que a variante preferida está na frente.

O problema: se você olha todo dia e pode parar a qualquer momento, a chance de encontrar uma diferença "significativa" por puro acaso sobe muito. Em amostra pequena, os números oscilam bastante nos primeiros dias — e quem para no pico está medindo a oscilação, não o efeito.

A correção é definir antes: quantos dias ou quantas conversões, e não olhar o resultado até lá. Se precisar acompanhar, acompanhe volume e funcionamento técnico, não o placar.

Testar várias coisas e reportar a que venceu

Se você roda oito testes e um dá resultado positivo, é provável que esse um seja acaso. Quanto mais coisas você testa simultaneamente, maior a chance de encontrar um "vencedor" que não existe.

Não significa parar de testar — significa tratar um resultado isolado com desconfiança e confirmar antes de generalizar.

Segmentar depois de ver o resultado

O teste deu neutro no geral, mas alguém percebe que funcionou bem para visitantes de celular vindos de busca orgânica em São Paulo. Se você fatiar os dados o suficiente, sempre encontra um recorte onde o efeito aparece.

Segmentação é legítima quando declarada antes, como parte da hipótese. Descoberta depois, é geração de hipótese — pode virar o próximo teste, nunca a conclusão do atual.

O que fazer antes de pensar em teste

Em volume baixo, há um trabalho preliminar que multiplica o valor de cada experimento e quase nunca é feito.

Aumentar o denominador

Se a página recebe 80 visitas por mês, nenhum método estatístico resolve. Às vezes o movimento mais inteligente não é testar melhor — é conseguir mais tráfego para a página que você quer testar.

Formas baratas de fazer isso: concentrar links internos de outras páginas na que será testada, incluir o link em assinatura de e-mail do comercial, mencionar em newsletter, e — o mais eficaz — verificar se a página está recebendo o tráfego de busca que deveria. Frequentemente ela existe e ninguém a linka de lugar nenhum.

Consolidar variações

Muitas operações têm quatro landing pages parecidas, cada uma com 20 visitas por mês. Consolidar em uma produz 80 — e uma página com quatro vezes mais dados vale mais que quatro páginas sem dado nenhum.

Isso também resolve um problema paralelo: quatro páginas parecidas competem entre si na busca, e nenhuma acumula sinal suficiente para ranquear.

Instrumentar direito

Antes de qualquer teste, verifique se você consegue medir o que pretende. Um número surpreendente de experimentos falha não por estatística, mas porque o evento de conversão não estava sendo registrado corretamente em uma das variantes.

O teste mínimo: acione o evento manualmente nas duas versões e confirme que ele aparece no relatório com o mesmo nome e o mesmo valor.

As cinco alternativas honestas

1. Subir o alvo no funil

A saída mais simples e a mais subutilizada. Se a conversão final tem volume pequeno demais, teste contra um evento anterior e mais frequente: cliques no botão principal, rolagem até a seção de preço, tempo na página de produto, abertura de um item de FAQ.

Você perde precisão sobre o resultado final e ganha muito em velocidade. Uma página com 80 conversões por mês pode ter 900 cliques no botão — volume que permite um teste real em semanas.

O cuidado: o evento intermediário precisa correlacionar com o resultado final. Vale verificar no histórico antes de adotá-lo como alvo. E vale reverificar de tempos em tempos, porque quando o time começa a otimizar o indicador, ele tende a descolar do resultado.

2. Buscar efeitos grandes em vez de incrementais

Se detectar 5% exige volume que você não tem e detectar 50% exige pouco, a conclusão prática é direta: teste mudanças grandes.

Reescreva a página inteira em vez de trocar o título. Troque a oferta em vez de ajustar a redação. Mude o formato do material em vez da cor do botão.

Isso tem um efeito colateral bom: mudanças grandes forçam o time a pensar em mecanismos maiores, e mecanismos maiores geram aprendizado mais transferível. Otimização incremental de botão raramente ensina algo aplicável em outro lugar.

3. Teste sequencial no tempo

Rode a versão A por um período, depois a B pelo mesmo período, e compare.

É metodologicamente inferior ao A/B verdadeiro, porque não isola o que mudou no mundo entre os dois períodos. Mas com períodos longos e simétricos, é informativo.

Precauções que fazem diferença: use períodos de duração idêntica e múltiplos de sete dias, para não misturar dias de semana com fins de semana; evite fim de trimestre, feriados prolongados e janeiro; verifique se não houve campanha, mudança de mídia ou pico de imprensa em um dos períodos; e se possível, rode A, depois B, depois A de novo — se a primeira e a terceira medição forem parecidas, ganha confiança de que o ambiente estava estável.

4. Comparar grupos em vez de visitantes

Quando o objeto do teste não é uma página mas um processo — abordagem comercial, cadência, formato de proposta —, o volume de unidades muda.

Você pode ter 80 visitas na landing page e 400 calls no trimestre. Dividir o time comercial em dois grupos, com abordagens diferentes, produz um experimento com volume utilizável.

O cuidado é que pessoas não são páginas: vendedores têm habilidades diferentes e sabem que estão sendo medidos. Duas correções ajudam — alternar qual grupo usa qual abordagem na metade do período, e comparar cada vendedor consigo mesmo em vez de comparar grupos entre si.

5. Pesquisa qualitativa como evidência legítima

Esta é a alternativa que mais gera resistência e frequentemente a mais útil.

Seis entrevistas em profundidade com compradores reais costumam ensinar mais sobre por que uma página não converte do que um teste subdimensionado. Não é estatisticamente representativo — e não precisa ser, porque o papel dela é diferente: gerar hipóteses, não confirmá-las.

Em operação com volume baixo, boa hipótese é o insumo mais escasso. Um time que faz seis entrevistas por trimestre e testa as três melhores ideias que surgiram dali supera um time que testa quinze ideias vindas de intuição.

Duas fontes qualitativas que rendem especialmente:

  • Gravação de sessão. Assistir vinte pessoas usarem a página revela travamentos que nenhum número mostra. É desconfortável e é o exercício de melhor retorno por hora.
  • Entrevista com quem escolheu o concorrente. Difícil de conseguir e a mais informativa de todas, porque a pessoa não tem incentivo para ser gentil.

Sobre ferramentas de teste

Uma observação prática, porque a escolha costuma consumir mais tempo do que merece.

Em volume baixo, a ferramenta importa pouco. Plataformas de teste A/B cobram por visitante e entregam recursos — segmentação avançada, alocação dinâmica de tráfego, cálculo automático de significância — que só fazem sentido com volume que você não tem. Pior: o cálculo automático de significância em amostra pequena é justamente o que produz a falsa certeza descrita acima, porque ele reporta um número que parece autoridade.

Para teste sequencial no tempo, você não precisa de ferramenta nenhuma: publica a versão A, registra o período, publica a B, registra o período, compara no analytics.

Para teste simultâneo com pouco volume, uma divisão simples no próprio código resolve. O que você precisa garantir é que a mesma pessoa veja sempre a mesma versão — caso contrário o resultado não significa nada.

Há um custo escondido que vale considerar: muitas ferramentas de teste aplicam a variação via JavaScript depois de a página carregar, o que causa um piscar visível e prejudica o tempo de carregamento. Em site B2B, onde o desempenho já é frequentemente frágil, isso pode contaminar o próprio resultado do teste.

Quando parar de tentar medir

Existe uma categoria de decisão em que insistir em medir é desperdício: mudanças de baixo custo com direção obviamente correta.

Se a página de preços não existe e o comercial ouve a pergunta em toda call, não é preciso testar se criá-la ajuda. Se um formulário pede o CNPJ duas vezes, não é preciso testar se remover a duplicata melhora. Se o site leva doze segundos para carregar no celular, não é preciso testar se melhorar isso é bom.

Essas são correções, não experimentos. Faça e siga em frente. O orçamento de experimentação — que em volume baixo é escasso — deve ir para as decisões em que você genuinamente não sabe a resposta.

O critério prático: se você não consegue escrever um cenário plausível em que a mudança piore as coisas, não é um experimento. É uma tarefa.

Escolhendo o método pelo que você tem

Um resumo para decidir rápido, a partir do volume disponível e do tipo de mudança:

SituaçãoMétodoO que se ganha e o que se perde
Centenas de conversões por variante A/B tradicional Rigor completo. Raro em B2B
Volume baixo na conversão, alto num evento anterior Alvo intermediário Velocidade; perde ligação direta com receita
Mudança grande, volume moderado A/B com efeito grande Viável; só serve para mudanças radicais
Volume baixo em tudo, ambiente estável Sequencial no tempo Utilizável; não isola sazonalidade
Mudança em processo comercial Grupos de vendedores Alto impacto; efeito de observação contamina
Não sabe nem o que testar Qualitativo Gera hipótese; não confirma nada

A linha mais importante é a última. Times com pouco volume gastam energia demais discutindo qual método estatístico usar quando o problema real é que não sabem o que testar. Em operação pequena, o gargalo quase nunca é a medição — é a qualidade da hipótese.

Acumulando confiança sem um teste conclusivo

Em volume baixo, raramente um único experimento resolve a dúvida. O que funciona é acumular evidência de origens diferentes até que ela converja.

Um exemplo de como isso se parece na prática. A hipótese é que compradores abandonam o formulário por não saberem se você atende o porte deles. As evidências que se somam:

  1. Gravações mostram pessoas rolando até o formulário, voltando ao topo e saindo
  2. Duas de seis entrevistas mencionaram a dúvida espontaneamente
  3. O registro de descarte no CRM mostra "achou que era para empresa maior" como motivo recorrente
  4. Um teste sequencial com logos de clientes do mesmo porte mostrou melhora, sem significância conclusiva
  5. O comercial relata que a objeção some quando a call começa citando um cliente parecido

Nenhuma das cinco prova nada sozinha. Juntas, formam um caso forte o suficiente para agir — e muito mais confiável que um único teste A/B subdimensionado que deu "significativo".

Essa é a mudança de mentalidade que a experimentação em B2B exige: de prova isolada para convergência de evidências. É menos elegante e mais honesto sobre o que se pode saber com o volume disponível.

Como reportar sem prometer precisão que não existe

Um risco prático: apresentar resultado de teste subdimensionado como se fosse conclusivo cria expectativa que vai cobrar você depois.

Três hábitos que protegem:

Reporte o intervalo, não o ponto. Em vez de "a variante B converteu 32% mais", diga "a variante B converteu mais, mas com o volume disponível o efeito real pode estar entre pequeno e grande". É menos impressionante e é verdade.

Declare o volume junto com o resultado. "18 conversões contra 12" comunica a fragilidade que "50% de melhora" esconde.

Separe o que foi medido do que foi concluído. A medição é um fato; a conclusão é uma interpretação. Registrar as duas separadamente permite reavaliar a conclusão depois sem refazer o teste.

A parte cultural, que decide se o método sobrevive

Todo o rigor descrito acima colide com uma realidade organizacional: rigor produz menos "vitórias" para reportar.

Um time que roda seis testes por trimestre e declara quatro vencedores parece melhor, no relatório mensal, que um time que roda dois testes e reporta um inconclusivo e um negativo. O segundo está fazendo o trabalho certo; o primeiro está produzindo ficção com aparência de dado.

Se a liderança avalia o time de growth pela contagem de experimentos bem-sucedidos, o incentivo empurra na direção errada — e nenhum argumento metodológico resiste a incentivo. O que se avalia precisa ser a qualidade do processo: a hipótese estava bem escrita, o período foi definido antes, o resultado foi lido com honestidade.

Uma consequência prática dessa mudança: "inconclusivo" precisa ser aceitável em público. Em volume baixo, é o desfecho mais comum, e um time que sente vergonha de reportá-lo vai encontrar formas de transformá-lo em vitória. Normalmente segmentando os dados até algo aparecer.

Vale explicitar isso na primeira reunião em que o método for adotado. É mais fácil combinar antes do que renegociar depois do primeiro resultado ruim.

Uma rotina que funciona com volume baixo

Juntando tudo, o ciclo que sustenta aprendizado em operação pequena:

Toda semana: assistir três gravações de sessão. Trinta minutos, e é a fonte mais barata de hipótese que existe.

Todo mês: uma entrevista com cliente recente ou com quem escolheu outro fornecedor. Doze por ano é mais pesquisa qualitativa do que a maioria das empresas B2B faz na vida.

Por trimestre: dois experimentos grandes, contra métricas intermediárias, com período definido antes. Não seis pequenos — dois grandes.

Sempre: registrar tudo, inclusive os inconclusivos. "Inconclusivo" é um resultado legítimo e o mais comum em volume baixo. Registrado, ele impede que alguém repita o mesmo teste em oito meses.

O que esse ritmo produz em um ano não é uma lista de vitórias. É um entendimento acumulado sobre por que as pessoas do seu mercado compram ou não — que é o ativo real, e o único que não depende de ter tráfego para ser construído.

Perguntas frequentes

Como fazer teste A/B com pouco tráfego?

Cinco alternativas funcionam: subir o alvo para um evento mais frequente no funil, testar mudanças grandes em vez de incrementais, usar teste sequencial no tempo com períodos simétricos, comparar grupos de vendedores quando a mudança é de processo, e usar pesquisa qualitativa como geradora de hipótese.

Quantas conversões são necessárias para um teste A/B?

Depende do tamanho do efeito buscado, e a relação é cruel: detectar melhoras pequenas exige amostras muito maiores. Como regra prática, menos de algumas centenas de conversões por variante não produz resultado confiável em um A/B tradicional.

Por que não devo parar o teste quando a variante vence?

Porque em amostra pequena os números oscilam bastante nos primeiros dias. Se você olha o placar diariamente e pode parar a qualquer momento, a chance de encontrar uma diferença por acaso sobe muito. Defina o período antes e não olhe o resultado até lá.

Pesquisa qualitativa substitui teste A/B?

Não substitui, mas cumpre um papel diferente e frequentemente mais valioso em volume baixo: gerar hipóteses. Seis entrevistas com compradores reais costumam ensinar mais sobre por que uma página não converte do que um teste subdimensionado.

Continue lendo

Mais artigos sobre Account-Based Marketing por Cleber Barbosa