A parte difícil de growth não é ter ideias. É manter um processo funcionando depois que a novidade passa.
O padrão é conhecido. Mês um: reunião de kickoff, quadro cheio de post-its, entusiasmo geral. Mês dois: três experimentos rodando, dois resultados inconclusivos. Mês três: a reunião semanal vira atualização de status, alguém falta, o quadro para de ser atualizado. Mês quatro: ninguém mais fala em experimentação, e a conclusão informal é que "não funcionou para a gente".
O que morreu não foi a ideia de experimentar. Foi a ausência de uma estrutura que sobrevivesse ao desânimo da primeira sequência de resultados negativos — que é inevitável, porque a maior parte dos experimentos falha.
Este artigo é sobre montar essa estrutura.
Por que o processo morre no terceiro mês
Vale entender as causas antes das soluções, porque cada uma pede uma defesa diferente.
A taxa de acerto é baixa e ninguém avisou. Em operações maduras, algo entre 70% e 80% dos experimentos não produz o efeito esperado. Se o time entrou esperando descobrir alavancas de crescimento toda semana, a sequência de resultados negativos é lida como fracasso pessoal e coletivo.
Os resultados não chegam. Em B2B, se você mede contra receita, o experimento de março responde em outubro. Sem resposta, não há aprendizado, e sem aprendizado o processo é só burocracia.
Nada é registrado. As conclusões ficam na cabeça de quem estava na reunião. Alguém sai, o conhecimento vai junto, e seis meses depois o time repete um teste já feito.
O time não tem autoridade. Se toda mudança depende de aprovação de outra área, o que sobra é mexer em landing page — que costuma ser a menor alavanca disponível.
Errar tem custo político. Se o experimento que falhou aparece como falha na avaliação de alguém, o time aprende rápido a propor só testes seguros. O processo continua acontecendo e para de produzir informação.
Não é a taxa de acerto. É quantos ciclos completos o time fecha por trimestre — ideia, execução, leitura, decisão. Um time que roda quatro experimentos por mês e aprende com todos supera um que roda um por trimestre e acerta.
O ciclo, com prazos
Um processo de experimentação tem quatro etapas. O que o torna sustentável não é a sofisticação de cada uma, mas o fato de terem prazo definido — sem prazo, a etapa de geração de ideias se estende indefinidamente e nada é executado.
Uma cadência que funciona em operações B2B pequenas e médias:
| Etapa | Prazo | Saída concreta |
|---|---|---|
| Geração de hipóteses | contínua, revisada mensalmente | Fila com 15 a 30 ideias escritas |
| Priorização | 1 hora, mensal | 3 a 5 hipóteses aprovadas para o mês |
| Execução | 2 a 4 semanas por experimento | Experimento rodando com medição definida |
| Leitura e decisão | 30 minutos por experimento | Linha no registro com decisão explícita |
A quarta etapa é a mais pulada e a que sustenta tudo. Um experimento que roda e não é lido formalmente não fechou o ciclo — ele consumiu recurso e não produziu conhecimento.
A fila de hipóteses
O erro inicial mais comum é tratar geração de ideias como evento: uma sessão de brainstorming que produz quarenta post-its e nunca mais se repete. Duas semanas depois as boas ideias acabaram e o time não tem de onde tirar mais.
Geração de hipótese precisa ser rotina alimentada por fontes fixas. Cinco que rendem:
Entrevistas com clientes recentes, incluindo quem escolheu o concorrente. Uma ou duas por mês. É a fonte de melhor qualidade e a que menos gente mantém.
Gravações de call de vendas. Onde a conversa trava, onde a objeção se repete, o que o comprador pergunta que o material não responde.
Dados de comportamento. Onde as pessoas param, onde voltam, onde abandonam. Não precisa de ferramenta sofisticada — o relatório de caminho no analytics já mostra padrão.
O próprio time comercial. Vendedores acumulam hipóteses e raramente são perguntados. Uma pergunta na reunião mensal: "se você pudesse mudar uma coisa no que o marketing manda, o que seria?".
Experimentos anteriores. Todo resultado, inclusive negativo, sugere o próximo teste. Se a prova social não moveu a conversão, a hesitação tem outra causa — qual?
Uma fila saudável tem entre quinze e trinta hipóteses escritas. Menos que isso e você vai testar o que sobrou; muito mais e a priorização vira exercício de planilha.
Escrever a hipótese antes de priorizar
Uma regra que muda o processo inteiro: só entra na priorização o que estiver escrito no formato completo.
Não é burocracia. Quando alguém é obrigado a articular o mecanismo — por que isso funcionaria —, boa parte das ideias morre ali, porque não tem mecanismo. Isso economiza semanas de execução em coisas que nunca tiveram fundamento.
O formato tem quatro partes: a observação que motivou, a mudança específica, o efeito esperado com direção e magnitude, e o mecanismo. Cinco minutos a mais para escrever, e a diferença é que uma hipótese assim pode ser refutada — se o resultado for negativo, você aprendeu algo, não só que "não funcionou".
Na prática, a regra funciona assim: qualquer pessoa joga a ideia crua na fila a qualquer momento. Antes da reunião de priorização, quem propôs escreve o formato completo das suas. As que não foram escritas ficam para o mês seguinte. Isso distribui o esforço e filtra por convicção — quem não investe cinco minutos provavelmente não acredita muito na ideia.
A reunião de priorização
Uma hora por mês, com pauta fixa e um resultado obrigatório: de três a cinco hipóteses aprovadas, cada uma com dono e prazo.
A pontuação por framework — impacto, confiança, facilidade — serve para ordenar, e vale ser honesto sobre o que ela é: você está multiplicando três estimativas. A nota final tem precisão ilusória.
O valor real do framework é a conversa que ele força. Quando duas pessoas dão notas de impacto muito diferentes para a mesma ideia, elas estão discordando sobre algo relevante — normalmente sobre onde está o gargalo do funil. Essa discordância vale mais que o ranking.
Três regras que mantêm a reunião produtiva:
- Cada hipótese tem cinco minutos. Se não dá para explicar em cinco, ela não está pronta.
- Discordância de nota vira discussão de tese, não de número. "Por que você acha que isso teria impacto alto?"
- A reunião não termina sem decisão. Adiar para "pensar melhor" é o começo do fim do processo.
Em contexto B2B, acrescente um eixo à pontuação: reversibilidade. Experimentos que afetam contas grandes existentes têm custo de erro assimétrico. Testar um fluxo novo de cobrança na base enterprise pode gerar um problema que nenhum aprendizado compensa.
Execução com critério de parada definido antes
Aqui está a disciplina que separa experimento de observação: defina antes o que vai medir, por quanto tempo, e qual resultado leva a qual decisão.
Sem isso, o que acontece é previsível: o experimento roda, alguém olha o painel na terça-feira, a variante B está na frente, e o time declara vitória. Isso não é experimento — é observar ruído e escolher a leitura favorável.
Quatro decisões tomadas antes de ligar:
A métrica principal. Uma só. Se você define três, sempre uma delas vai ter subido, e você vai encontrar sucesso em qualquer resultado.
O período mínimo. Pelo menos duas semanas cheias, para cobrir variação de dia da semana. Em B2B, ciclos de compra têm padrão semanal forte — segunda-feira não se parece com sexta.
O tamanho de efeito que interessa. Uma melhora de 2% provavelmente não é detectável no seu volume e provavelmente não muda nada no negócio. Defina o mínimo que justificaria a mudança permanente.
A decisão associada a cada desfecho. Se subir acima do limiar, implementamos. Se ficar dentro do ruído, descartamos e testamos outra coisa. Se piorar, revertemos e investigamos por quê. Escrever isso antes elimina a discussão emocional depois.
Adaptando ao volume baixo do B2B
A objeção mais frequente contra experimentação em B2B é legítima: não há volume para testar nada com rigor. Vale enfrentá-la de frente, porque a resposta define boa parte do desenho do processo.
O problema, dimensionado
Um teste A/B tradicional precisa de milhares de conversões por variante para distinguir efeito real de variação aleatória. Se a sua landing page recebe oitenta visitas por mês e converte quatro, o teste levaria anos.
O que a maioria dos times faz é rodar mesmo assim, parar quando a variante B aparece na frente, e declarar vitória. Isso gera confiança em uma conclusão falsa — e pior, o time passa a aplicar aquele "aprendizado" em outros lugares.
Quatro adaptações que funcionam
Mova o alvo para cima no funil. Se a conversão final tem volume baixo demais, teste contra um evento mais frequente: cliques no CTA, rolagem até a seção de preço, abertura da página de produto. Perde-se precisão sobre o resultado final e ganha-se velocidade de aprendizado.
Busque efeitos grandes. Detectar 3% de melhora exige amostra enorme; detectar 50% exige muito menos. Em volume baixo, teste mudanças estruturais — reescreva a página inteira em vez de trocar a cor do botão. Otimização incremental é um luxo de quem tem tráfego.
Use teste sequencial no tempo. Rode a versão A por um período, depois a B pelo mesmo período, e compare. Não isola sazonalidade e vale menos que um A/B verdadeiro, mas com períodos longos e simétricos é informativo. Evite comparar fim de trimestre com meio.
Aceite pesquisa qualitativa como evidência. Seis entrevistas em profundidade frequentemente ensinam mais sobre por que a página não converte do que um teste subdimensionado. Não é estatisticamente representativo e não precisa ser — é gerador de hipótese, e boa hipótese é o insumo mais escasso do processo.
Onde há volume em B2B
Uma reformulação útil: em vez de forçar experimentação onde não há volume, procure onde há.
- Prospecção. Assunto de e-mail, ângulo, canal, cadência. Centenas de envios por mês, resposta em dias.
- Processo comercial. Estrutura da primeira call, ordem da demonstração, formato da proposta. Volume de calls costuma superar volume de conversões no site.
- Onboarding. Impacta retenção e expansão, que valem mais que aquisição em negócio recorrente.
- Qualificação. Perguntas do formulário, critérios de aceite, roteamento.
Uma provocação: se todos os seus experimentos do último trimestre foram no site, você provavelmente está otimizando a menor alavanca disponível — e ainda por cima a de pior volume.
A leitura, que é onde o aprendizado acontece
Trinta minutos por experimento encerrado, com quatro perguntas:
O que aconteceu? O número, sem interpretação.
A hipótese se confirmou? Sim, não, ou inconclusivo. As três respostas são válidas. "Inconclusivo" é honesto e frequente — significa que o volume não permitiu distinguir.
O que isso nos ensina sobre o cliente? A pergunta mais importante e a mais pulada. Um resultado negativo em prova social não ensina "logo não funciona" — ensina que a hesitação tem outra origem, e aponta para o próximo teste.
Qual a decisão? Implementar, descartar, ou rodar de novo com ajuste. Explícita, com dono.
Um cuidado que evita muito autoengano: quem lê o resultado não deve ser só quem propôs a hipótese. Existe um viés natural de enxergar confirmação no próprio trabalho. Duas pessoas na leitura resolve isso sem burocracia.
O registro, que é o ativo real
Um documento único, uma linha por experimento, com sete colunas: data, hipótese resumida, o que foi feito, métrica, resultado, decisão, e o que aprendemos.
Sem ele, o time repete testes já feitos, perde o conhecimento quando alguém sai, e não consegue enxergar padrão entre experimentos — que é onde estão as descobertas maiores.
Com ele, depois de um ano você tem uma base sobre o próprio mercado que nenhum concorrente consegue copiar, porque foi construída com dados que só você tem.
Duas regras sobre o registro: registre também os que falharam — são a maioria e são o que impede repetição —, e registre os que foram cancelados, com o motivo. Saber que uma ideia foi descartada por inviabilidade técnica evita que ela volte à fila em seis meses.
Quem faz o quê
Growth não é cargo — é função que atravessa áreas. Isso significa que o desenho de responsabilidades importa mais aqui do que em um time convencional, onde a hierarquia já resolve.
Quatro papéis precisam existir, mesmo que concentrados em duas ou três pessoas:
Quem prioriza. Conduz a reunião mensal e decide o que entra. Precisa de mandato explícito da liderança para pedir mudanças em marketing, produto e vendas. Sem isso, o time fica limitado ao que consegue mexer sozinho.
Quem analisa. Define a medição antes, lê o resultado depois e sabe a diferença entre efeito e ruído. É o papel mais difícil de preencher e o que mais protege o processo de autoengano.
Quem implementa. Consegue colocar um experimento no ar sem depender de fila de outra área. Se cada teste exige abrir chamado e esperar duas semanas, a cadência morre por atrito.
Quem conhece o cliente. Normalmente alguém do comercial ou do sucesso do cliente, participando das reuniões. É quem impede que o time teste coisas que não fazem sentido no mercado real.
Em operação pequena, uma pessoa pode acumular dois papéis. O que não funciona é acumular análise com priorização na mesma pessoa que propôs a hipótese — é onde o viés de confirmação faz mais estrago.
O patrocínio, que é a condição de existência
Vale dizer com clareza: sem alguém na liderança que defenda o processo quando ele não estiver produzindo resultado — e ele não vai produzir nos primeiros meses —, ele não sobrevive.
Esse patrocínio precisa ser negociado no início, com expectativa escrita: quantos ciclos por trimestre, qual taxa de acerto esperada, em quanto tempo se avalia. Combinar isso depois, sob pressão de resultado, nunca funciona.
A defesa cultural
Nenhuma estrutura sobrevive a uma cultura que pune erro. Três medidas concretas, não declarações de intenção:
Avalie o processo, não o resultado. O que se cobra é a qualidade da hipótese, da execução e da leitura. Um experimento bem desenhado que refuta a hipótese é trabalho de qualidade, e precisa ser tratado assim em público — na reunião, na frente de todo mundo.
Comunique a taxa de acerto esperada antes de começar. Se a liderança sabe desde o início que 70% a 80% dos testes não vão dar certo, a sequência negativa deixa de ser crise.
Celebre o aprendizado caro. O experimento que evitou uma decisão errada de produto vale mais que o que melhorou 3% na conversão de uma página. Mas só o segundo aparece no relatório, então o primeiro precisa ser nomeado explicitamente.
Existe o vício oposto, e vale mencionar: o time que celebra "aprendizados" indefinidamente sem produzir impacto. Aprendizado sem consequência é entretenimento caro. Se depois de dois trimestres nenhuma métrica de negócio se moveu, o problema não é cultura — é que os experimentos estão pequenos demais ou no lugar errado.
Os primeiros 90 dias
Não comece pelo experimento. Comece pela infraestrutura de aprendizado.
Mês 1 — instrumentação. Descubra o que você consegue medir hoje e o que não consegue. Analise o histórico de negócios ganhos e perdidos procurando a métrica intermediária que correlaciona com receita e responde rápido. Crie o registro, mesmo vazio. Não rode nada.
Mês 2 — geração. Entreviste de seis a dez clientes recentes. Ouça vinte gravações de call. Monte a fila sem filtrar. Só então priorize, e escreva as cinco melhores no formato completo.
Mês 3 — execução. Rode de dois a quatro experimentos. Deliberadamente, escolha ao menos um fora do site — processo comercial, prospecção, onboarding. Documente todos. Faça a primeira leitura formal.
Ao fim do trimestre você não terá crescimento. Terá um processo funcionando, um registro com quatro entradas e conhecimento sobre o funil que não existia. É devagar, e é a única forma que compõe.
Como saber se o processo pegou
Quatro sinais que aparecem antes de qualquer métrica de negócio se mover:
Pessoas de fora do time propõem hipóteses. Quando alguém do comercial ou do suporte manda uma ideia no formato certo, o processo virou cultura em vez de ritual de um grupo.
Alguém consulta o registro antes de propor. É o sinal de que ele deixou de ser arquivo morto.
O time discorda sobre onde está o gargalo — com dados. Discordância informada é sinal de que as pessoas estão pensando no problema, não executando tarefas.
Um experimento é cancelado no meio por bom motivo. Perceber durante a execução que a hipótese estava mal formulada e parar antes de gastar mais é maturidade, não desperdício. Times imaturos levam tudo até o fim para não "perder o trabalho".
Perguntas frequentes
Por que processos de experimentação morrem no terceiro mês?
Cinco causas se combinam: a taxa de acerto é baixa e ninguém avisou, os resultados demoram a chegar em ciclos B2B longos, nada é registrado, o time não tem autoridade para mexer fora do site, e errar tem custo político.
Quantos experimentos rodar por mês?
De três a cinco em operação pequena ou média. O indicador de saúde não é a taxa de acerto, e sim quantos ciclos completos o time fecha por trimestre — ideia, execução, leitura e decisão.
Como experimentar com pouco volume de tráfego?
Quatro adaptações: mover o alvo para um evento mais frequente no funil, buscar efeitos grandes em vez de incrementais, usar teste sequencial no tempo, e aceitar pesquisa qualitativa como geradora de hipótese. E procurar volume onde ele existe: prospecção, processo comercial e onboarding.
O que precisa estar no registro de experimentos?
Data, hipótese resumida, o que foi feito, métrica, resultado, decisão e o que se aprendeu. Registre também os que falharam, que são a maioria, e os cancelados com o motivo — é o que impede o time de repetir testes já feitos.


