Quanto Tempo Executar Testes A/B de Anúncios: Matemática de Tamanho de Amostra Tornada Prática
A duração de teste A/B é aritmética, não folclore: amostra necessária dividida pelo volume diário. Aqui está a matemática de tamanho de amostra tornada utilizável, mais os limites inferiores, superiores e regras de interrupção que mantêm os testes acessíveis.

Execute um teste A/B de anúncio até que cada variante tenha coletado conversões suficientes para tornar a diferença que você se importa visível — não por um número fixo de dias. Como regra prática, isso significa pelo menos uma semana completa para cobrir ciclos de dia da semana, e entre 50 e alguns milhares de conversões por variante, dependendo de quão pequena a diferença que você deseja detectar. A duração é um resultado de aritmética, não uma preferência de calendário: dias necessários = amostra requerida por variante ÷ seu volume diário por variante. Este artigo fornece essa aritmética, os limites inferiores e superiores que a substituem, e a sequência de teste mais econômica a usar quando a matemática indica que você não pode pagar pela significância.
A duração é um resultado, não uma escolha de calendário#
A maioria dos conselhos oferece uma resposta fixa — sete dias, quatorze dias, um mês. Dias são a unidade errada. Uma campanha que gera 40 conversões por dia resolve um teste de landing page em cerca de uma semana; o mesmo teste em uma campanha que gera 4 por dia leva mais de dois meses, ponto em que o resultado já está contaminado por tudo que mudou no meio‑tempo. Três entradas decidem sua duração real:
- A taxa base da métrica que você está testando — CTR para criativos, conversion rate para landing pages e ofertas.
- A menor diferença que vale a pena detectar. Detectar um aumento de 10% custa muito mais tráfego que detectar um aumento de 50%, e a maioria dos pequenos aumentos não compensa o gasto necessário para observá‑los.
- Volume diário por variante — definido pelo seu orçamento e lances.
Corrija as duas primeiras e a amostra requerida surge de uma fórmula. Divida pela terceira e você tem sua duração. Se a resposta ultrapassar cerca de quatro semanas, a medida correta costuma ser mudar o teste, não prolongá‑lo — mais detalhes abaixo.
A matemática de tamanho de amostra, sem o grau de estatística#
O atalho padrão para um teste de duas variantes com 95% de confiança e 80% de poder:
n por variante ≈ 16 × p × (1 − p) ÷ d²
onde p é sua taxa base em decimal e d é a diferença absoluta que você deseja detectar. Dois exemplos trabalhados:
- Teste criativo em nível de CTR. CTR base 0,5%, detectando um aumento relativo de 20% (0,1 ponto absoluto): n ≈ 16 × 0,005 × 0,995 ÷ 0,001² ≈ 80.000 impressões por variante. Posicionamentos nativos entregam impressões rápido e barato, então isso pode ser resolvido em dias.
- Teste de landing page em nível de conversão. Taxa de conversão base 2%, detectando um aumento relativo de 25% (0,5 ponto absoluto): n ≈ 16 × 0,02 × 0,98 ÷ 0,005² ≈ 12.500 cliques por variante. A $0,40 CPC isso representa um teste de cinco dígitos para um único par de páginas.
| O que você está testando | Base | Aumento a detectar | Amostra por variante |
|---|---|---|---|
| CTR (criativo) | 0,5% | 20% relativo | ~80.000 impressões |
| CTR (criativo) | 0,5% | 50% relativo | ~13.000 impressões |
| CVR (landing) | 2% | 25% relativo | ~12.500 cliques |
| CVR (landing) | 2% | 50% relativo | ~3.100 cliques |
| CVR (página de oferta) | 5% | 25% relativo | ~4.900 cliques |
Duas lições surgem dessa tabela. Primeiro, pequenos aumentos são brutalmente caros: reduzir à metade a diferença detectável quadruplica a amostra. Segundo, testar em nível de impressão custa uma fração pequena do teste em nível de clique. Essa assimetria deve moldar todo o seu programa de testes: teste ângulos criativos em nível de CTR, teste funis em nível de conversão, e não teste mudanças de cor de botão — a amostra necessária para detectá‑las raramente paga por si mesma.
O limite inferior: uma semana completa, seja o que for a matemática#
Mesmo quando o volume entrega sua amostra em dois dias, rode pelo menos sete. Audiências de dias úteis e fins de semana se comportam de forma diferente — pessoas diferentes, dispositivos diferentes, intenções diferentes. A mistura de publishers em redes nativas gira ao longo da semana conforme ciclos de notícias e agendas de conteúdo mudam, então o tráfego de terça‑feira não é o mesmo de sábado. O atraso de conversão adiciona um segundo viés: cliques de quinta‑feira podem converter no sábado, de modo que um corte precoce favorece sistematicamente a variante que recebeu impressões primeiro. Um teste que termina no meio da semana amostra um recorte enviesado do seu tráfego real, e o "vencedor" pode ser simplesmente o especialista em dias úteis.
O limite superior: testes longos apodrecem por dentro#
Passadas três a quatro semanas, um teste A/B deixa de ser um experimento controlado. Creative fatigue decai ambas as variantes — raramente na mesma velocidade, o que silenciosamente reverte rankings durante o teste. Concorrentes entram e saem do leilão e alteram a qualidade do seu tráfego. A sazonalidade desliza sob toda a comparação. Se a fórmula indica que você precisa de seis semanas de tráfego, leia isso como um veredicto: a diferença que você persegue é pequena demais para ser detectada com seu volume. Teste um swing maior — um hook or angle diferente, uma estrutura de funil diferente — onde a diferença detectável é grande e a amostra é acessível.
Não espreite — ou pelo menos não aja sobre espreitadas#
O modo clássico de falha: verificar o dashboard diariamente e declarar vitória no primeiro dia em que os números parecem significativos. Olhares repetidos aos dados acumulados inflacionam falsos positivos drasticamente — com espreita diária, uma regra de parada "atingiu significância em algum ponto" dispara muito mais vezes que a taxa de erro anunciada de 5%. A regressão à média então explica a maioria das reclamações "meu vencedor parou de vencer": a variante que disparou no dia dois estava surfando em ruído, e ela recua. A disciplina é simples: comprometa previamente seu tamanho de amostra, monitore diariamente apenas para condições de stop‑loss — rastreamento quebrado, gasto descontrolado, variante com desempenho catastrófico — e avalie o vencedor uma única vez, ao final.
Regras de interrupção para quando você não pode pagar pela significância#
A maioria dos compradores nativos e afiliados não pode financiar 12.500 cliques por variante, e fingir o contrário gera rigor falso. A alternativa honesta é a eliminação em etapas — mais crua que teste de significância, e prática padrão entre compradores que testam dezenas de criativos por mês:
- Eliminação por CTR (dias 1–3). Dê a cada criativo algumas milhares de impressões, então elimine tudo claramente abaixo da média. Você não está provando nada — está triando para que o orçamento se concentre em vencedores plausíveis.
- Barreira de gasto (rolling). Regra comum de praticantes: pause qualquer variante que tenha gasto 2–3× seu CPA alvo sem conversões. Isso não é estatística; é sobrevivência.
- Significância nos finalistas. Quando dois ou três sobreviventes concentram a maior parte do gasto, execute um teste adequado em nível de conversão entre eles usando a matemática acima. Você financia um teste real em vez de dez falsos.
Atalhe a amostra: comece a partir de anúncios que já sobreviveram#
Cada variante que você não precisa testar é dinheiro economizado, e a informação mais barata sobre o que funciona é o que os concorrentes continuam pagando para rodar. Um anúncio que rodou por mais de 30 dias passou pela verificação de lucratividade do proprietário a cada dia desse período. O índice da OpenAdLibrary de mais de 725.000 criativos nativos ativos em 49 redes (junho 2026) registra datas de primeira e última visualização para cada criativo, transformando ad longevity em um sinal filtrável ao invés de um palpite — os longest-running native ads no seu segmento são uma grade de partida pré‑testada. Construa seu teste em torno de dois ou três angles already proven in the wild e você estará testando variações de um vencedor ao invés de suposições frias; você pode navegar criativos concorrentes ao vivo gratuitamente com a native ad research tool. Menos variantes, melhores, significam amostras menores, testes mais curtos e menos orçamento gasto em descoberta.
Um exemplo trabalhado, do início ao fim#
Suponha que você rode uma oferta de geração de leads com payout de $60 e uma campanha que gera aproximadamente 1.500 cliques por dia nas suas células de teste.
- Etapa criativa: quatro criativos competem em nível de CTR. Algumas milhares de impressões cada resolvem em 2–3 dias; elimine até os dois melhores.
- Etapa de landing: duas landing pages em nível de conversão. CVR base em torno de 3%, detectando um aumento relativo de 30% (0,9 ponto absoluto): n ≈ 16 × 0,03 × 0,97 ÷ 0,009² ≈ 5.700 cliques por variante, cerca de 11.400 no total. A 1.500 cliques por dia isso corresponde a oito dias — chame de uma semana completa mais cobertura de fim de semana.
- Veredito: um ciclo de teste dura 10–12 dias desde o lançamento até um vencedor defensável, com gasto perdedor limitado pela regra de barreira de gasto ao invés de deixado rodando na esperança.
Esse é o formato realista de "quanto tempo": alguns dias de triagem barata, mais de uma semana de medição focada, e um comprimento de calendário ditado pelo seu volume de cliques — não por um número mágico de dias.







