Cuánto tiempo ejecutar pruebas A/B de anuncios: matemáticas del tamaño muestral hechas prácticas
La duración de una prueba A/B es aritmética, no folclore: muestra requerida dividida por el volumen diario. Aquí están las matemáticas del tamaño muestral hechas útiles, más los pisos, techos y reglas de corte que mantienen las pruebas asequibles.

Ejecuta una prueba A/B de anuncios hasta que cada variante haya recogido suficientes conversiones para hacer visible la diferencia que te importa, no durante un número fijo de días. Como regla práctica, eso significa al menos una semana completa para cubrir ciclos de día de la semana, y entre 50 y unos pocos miles de conversiones por variante dependiendo de qué tan pequeña sea la diferencia que quieres detectar. La duración es un resultado de la aritmética, no una preferencia de calendario: días necesarios = muestra requerida por variante ÷ tu volumen diario por variante. Este artículo te da esa aritmética, los pisos y techos que la anulan, y la secuencia de pruebas más barata a usar cuando las matemáticas dicen que no puedes permitirte la significancia.
La duración es un resultado, no una elección de calendario#
La mayoría de los consejos te dan una respuesta fija: siete días, catorce días, un mes. Los días son la unidad equivocada. Una campaña que genera 40 conversiones al día resuelve una prueba de lander en aproximadamente una semana; la misma prueba en una campaña que genera 4 al día toma más de dos meses, momento en el que el resultado está contaminado por todo lo que cambió en el medio. Tres entradas deciden tu duración real:
- La tasa base de la métrica que estás probando: CTR para creatividades, tasa de conversión para landers y ofertas.
- La diferencia más pequeña que vale la pena detectar. Detectar una mejora del 10% cuesta mucho más tráfico que detectar una del 50%, y la mayoría de las mejoras pequeñas no valen el gasto que se necesita para verlas.
- Volumen diario por variante, determinado por tu presupuesto y pujas.
Fija las dos primeras y la muestra requerida se deriva de una fórmula. Divide por la tercera y tienes tu duración. Si la respuesta resulta ser más larga que unas cuatro semanas, el movimiento correcto suele ser cambiar la prueba, no prolongarla: más sobre eso a continuación.
Las matemáticas del tamaño muestral, sin el título de estadística#
El atajo estándar para una prueba de dos variantes con 95% de confianza y 80% de potencia:
n por variante ≈ 16 × p × (1 − p) ÷ d²
donde p es tu tasa base como decimal y d es la diferencia absoluta que quieres detectar. Dos ejemplos trabajados:
- Prueba creativa a nivel de CTR. CTR base 0.5%, detectando una mejora relativa del 20% (0.1 puntos absolutos): n ≈ 16 × 0.005 × 0.995 ÷ 0.001² ≈ 80,000 impresiones por variante. Los espacios nativos sirven impresiones rápido y barato, así que esto puede resolverse en días.
- Prueba de lander a nivel de conversión. Tasa de conversión base 2%, detectando una mejora relativa del 25% (0.5 puntos absolutos): n ≈ 16 × 0.02 × 0.98 ÷ 0.005² ≈ 12,500 clics por variante. A un CPC de $0.40, eso es una prueba de cinco cifras para un solo par de páginas.
| Qué estás probando | Base | Mejora a detectar | Muestra por variante |
|---|---|---|---|
| CTR (creatividad) | 0.5% | 20% relativo | ~80,000 impresiones |
| CTR (creatividad) | 0.5% | 50% relativo | ~13,000 impresiones |
| CVR (lander) | 2% | 25% relativo | ~12,500 clics |
| CVR (lander) | 2% | 50% relativo | ~3,100 clics |
| CVR (página de oferta) | 5% | 25% relativo | ~4,900 clics |
Dos lecciones surgen de esa tabla. Primero, las mejoras pequeñas son brutalmente caras: reducir a la mitad la diferencia detectable cuadruplica la muestra. Segundo, probar a nivel de impresión cuesta una pequeña fracción de probar a nivel de clic. Esa asimetría debería moldear todo tu programa de pruebas: prueba ángulos creativos a nivel de CTR, prueba embudos a nivel de conversión, y no pruebes cambios del tamaño del color de un botón: la muestra necesaria para detectarlos rara vez se paga por sí misma.
El piso: una semana completa, pase lo que pase con las matemáticas#
Incluso cuando el volumen entrega tu muestra en dos días, ejecuta al menos siete. Las audiencias de días laborables y fines de semana se comportan de manera diferente: personas diferentes, dispositivos diferentes, intención diferente. La mezcla de editores en redes nativas rota durante la semana a medida que cambian los ciclos de noticias y los horarios de contenido, por lo que el tráfico del martes no es el del sábado. El retraso en la conversión añade un segundo sesgo: los clics del jueves de una variante pueden convertirse el sábado, por lo que un corte temprano favorece sistemáticamente a la variante que por casualidad recibió sus impresiones primero. Una prueba que termina a mitad de semana ha muestreado una porción sesgada de tu tráfico real, y el "ganador" puede ser simplemente el especialista en días laborables.
El techo: las pruebas largas se pudren por dentro#
Pasadas tres o cuatro semanas, una prueba A/B deja de ser un experimento controlado. La fatiga creativa decae ambas variantes, rara vez a la misma velocidad, lo que revierte silenciosamente las clasificaciones a mitad de la prueba. Los competidores entran y salen de la subasta y cambian la calidad de tu tráfico. La estacionalidad se desvía debajo de toda la comparación. Si la fórmula dice que necesitas seis semanas de tráfico, léelo como un veredicto: la diferencia que estás buscando es demasiado pequeña para detectarla con tu volumen. Prueba un cambio más grande en su lugar: un gancho o ángulo diferente, una estructura de embudo diferente, donde la diferencia detectable sea grande y la muestra sea asequible.
No eches un vistazo, o al menos no actúes basándote en ellos#
El modo de fallo clásico: revisa el panel diariamente y declara la victoria el primer día que los números parezcan significativos. Las miradas repetidas a los datos acumulados inflan dramáticamente los falsos positivos: con miradas diarias, una regla de parada de "alcanzó significancia en algún momento" se dispara mucho más a menudo que la tasa de error anunciada del 5%. La regresión a la media explica entonces la mayoría de las quejas de "mi ganador dejó de ganar": la variante que se adelantó el día dos estaba montando ruido, y retrocede. La disciplina es simple: comprométete de antemano a tu tamaño muestral, monitorea diariamente solo para condiciones de stop-loss (seguimiento roto, gasto descontrolado, una variante con rendimiento catastrófico) y evalúa al ganador una vez, al final.
Reglas de corte para cuando no puedes permitirte la significancia#
La mayoría de los compradores nativos y de afiliados no pueden financiar 12,500 clics por variante, y fingir lo contrario produce un rigor falso. La alternativa honesta es el descarte por etapas, más crudo que las pruebas de significancia y práctica estándar entre compradores que prueban docenas de creatividades al mes:
- Descarte por CTR (días 1–3). Dale a cada creatividad unos pocos miles de impresiones, luego mata todo lo que esté claramente por debajo del grupo. No estás probando nada, estás haciendo triaje para que el presupuesto se concentre en ganadores plausibles.
- Límite de gasto (continuo). Una regla común de los profesionales: pausa cualquier variante que haya gastado 2–3× tu CPA objetivo con cero conversiones. Eso no es estadística; es supervivencia.
- Significancia en los finalistas. Una vez que dos o tres supervivientes llevan la mayor parte del gasto, ejecuta una prueba adecuada a nivel de conversión entre ellos usando las matemáticas anteriores. Financias una prueba real en lugar de diez falsas.
Acorta la muestra: comienza con anuncios que ya sobrevivieron#
Cada variante que no necesitas probar es dinero ahorrado, y la información más barata sobre lo que funciona es lo que los competidores siguen pagando por ejecutar. Un anuncio que ha estado en ejecución durante 30+ días ha pasado la verificación de rentabilidad de su propietario cada día de esa ejecución. El índice de OpenAdLibrary de más de 725,000 creatividades nativas activas en 49 redes (junio de 2026) registra las fechas de primera y última vista para cada creatividad, lo que convierte la longevidad del anuncio en una señal filtrable en lugar de una corazonada: los anuncios nativos de mayor duración en tu vertical son una parrilla de salida preprobada. Construye tu prueba alrededor de dos o tres ángulos ya probados en el mercado y estarás probando variaciones de un ganador en lugar de conjeturas frías; puedes navegar por creatividades de competidores en vivo gratis con la herramienta de investigación de anuncios nativos. Menos y mejores variantes significan muestras más pequeñas, pruebas más cortas y menos presupuesto quemado en descubrimiento.
Un ejemplo trabajado, de principio a fin#
Supongamos que ejecutas una oferta de generación de leads con un pago de $60, con una campaña que genera aproximadamente 1,500 clics al día en tus celdas de prueba.
- Etapa creativa: cuatro creatividades compiten a nivel de CTR. Unos pocos miles de impresiones cada una se resuelve en 2–3 días; descarta a las dos mejores.
- Etapa de lander: dos landers a nivel de conversión. CVR base alrededor del 3%, detectando una mejora relativa del 30% (0.9 puntos absolutos): n ≈ 16 × 0.03 × 0.97 ÷ 0.009² ≈ 5,700 clics por variante, unos 11,400 en total. A 1,500 clics al día, eso son ocho días: llámalo una semana completa más cobertura de fin de semana.
- Veredicto: un ciclo de prueba dura 10–12 días desde el lanzamiento hasta un ganador defendible, con el gasto perdedor limitado por la regla del límite en lugar de dejarlo corriendo con esperanza.
Esa es la forma realista de "cuánto tiempo": unos días de triaje barato, una semana o más de medición enfocada, y una duración de calendario dictada por tu volumen de clics, no por el número mágico de días de nadie.







