Как долго проводить A/B‑тесты рекламных объявлений: практический расчёт размера выборки
Продолжительность A/B‑теста – это арифметика, а не народная мудрость: требуемая выборка делится на ежедневный объём. Здесь представлен практический расчёт размера выборки, а также «полы», «потолки» и правила прекращения, позволяющие держать тесты в рамках бюджета.

Проводите A/B‑тест рекламного объявления до тех пор, пока каждый вариант не соберёт достаточно конверсий, чтобы разница, которая вас интересует, стала видимой — а не фиксированное количество дней. Как практическое правило, это означает минимум одну полную неделю, чтобы покрыть суточные циклы, и от 50 до нескольких тысяч конверсий на вариант в зависимости от того, насколько небольшую разницу вы хотите обнаружить. Продолжительность — это результат арифметики, а не предпочтение календаря: дни = требуемая выборка на вариант ÷ ваш ежедневный объём на вариант. Эта статья предоставляет вам эту арифметику, «полы» и «потолки», которые её переопределяют, и более экономичную последовательность тестирования, когда расчёт показывает, что вы не можете позволить себе значимость.
Продолжительность — это результат, а не календарный выбор#
Большинство рекомендаций дают фиксированный ответ — семь дней, четырнадцать дней, месяц. Дни — неверная единица измерения. Кампания, генерирующая 40 конверсий в день, решает тест посадочной страницы примерно за неделю; тот же тест в кампании с 4 конверсиями в день займёт более двух месяцев, к чему результат будет уже искажён всеми изменениями за это время. Три входных параметра определяют реальную продолжительность:
- Базовый уровень метрики, которую вы тестируете — CTR для креативов, conversion rate для посадочных страниц и офферов.
- Наименьшее различие, которое стоит обнаружить. Обнаружение 10 % прироста требует гораздо больше трафика, чем обнаружение 50 % прироста, и большинство небольших приростов не оправдывают затраты на их выявление.
- Ежедневный объём на вариант — задаётся вашим бюджетом и ставками.
Зафиксируйте первые два параметра, и требуемая выборка вытекает из формулы. Разделите её на третий параметр — получите продолжительность. Если полученный результат превышает примерно четыре недели, правильным шагом обычно будет изменение теста, а не его «выживание» — подробнее ниже.
Расчёт размера выборки без степени статистики#
Стандартный упрощённый расчёт для двухвариантного теста при 95 % надёжности и 80 % мощности:
n per variant ≈ 16 × p × (1 − p) ÷ d²
где p — ваш базовый уровень в виде десятичной дроби, а d — абсолютная разница, которую хотите обнаружить. Два примера расчётов:
- Тест креатива на уровне CTR. Базовый CTR 0,5 %, обнаружение 20 % относительного прироста (0,1 п.п. абсолютного): n ≈ 16 × 0.005 × 0.995 ÷ 0.001² ≈ 80 000 показов на вариант. Native‑размещения показывают имппрессионы быстро и дешево, поэтому такой тест решается за дни.
- Тест посадочной страницы на уровне конверсии. Базовый коэффициент конверсии 2 %, обнаружение 25 % относительного прироста (0,5 п.п. абсолютного): n ≈ 16 × 0.02 × 0.98 ÷ 0.005² ≈ 12 500 кликов на вариант. При стоимости $0.40 CPC это уже пятизначный тест для одной пары страниц.
| Что тестируется | Базовый уровень | Прирост для обнаружения | Выборка на вариант |
|---|---|---|---|
| CTR (креатив) | 0.5% | 20% относительный | ~80 000 показов |
| CTR (креатив) | 0.5% | 50% относительный | ~13 000 показов |
| CVR (лендер) | 2% | 25% относительный | ~12 500 кликов |
| CVR (лендер) | 2% | 50% относительный | ~3 100 кликов |
| CVR (страница оффера) | 5% | 25% относительный | ~4 900 кликов |
Из этой таблицы вытекают два вывода. Во‑первых, небольшие приросты чрезвычайно дороги: уменьшение обнаруживаемой разницы вдвое приводит к увеличению выборки в четыре раза. Во‑вторых, тестирование на уровне показов стоит лишь малой части от тестирования на уровне кликов. Эта асимметрия должна формировать всю вашу программу тестирования: тестируйте креативные углы на уровне CTR, тестируйте воронки на уровне конверсии и вовсе не тестируйте изменения типа «цвет кнопки», поскольку требуемая выборка для их обнаружения почти никогда не окупается.
Пол: минимум одна полная неделя, независимо от расчётов#
Даже если объём доставляет вашу выборку за два дня, запускайте тест минимум семь дней. Аудитории в будние и выходные дни ведут себя по‑разному — разные люди, разные устройства, разный намерения. Смесь издателей в native‑сетях меняется в течение недели в зависимости от новостных циклов и расписания контента, поэтому трафик во вторник не равен трафику в субботу. Задержка конверсии добавляет второе искажение: клики варианта в четверг могут конвертироваться в субботу, поэтому раннее обрезание систематически отдаёт предпочтение тому варианту, который получил показы первым. Тест, завершающийся в середине недели, охватывает лишь искажённый срез вашего реального трафика, и «победитель» может оказаться просто специалистом по буднему дню.
Потолок: длительные тесты «гниют» изнутри#
После трёх‑четырёх недель A/B‑тест перестаёт быть контролируемым экспериментом. Creative fatigue уменьшает эффективность обоих вариантов — редко одинаково, что тихо меняет ранжирование в середине теста. Конкуренты входят и выходят из аукциона, меняя качество вашего трафика. Сезонность смещает всё сравнение. Если формула требует шести недель трафика, воспринимайте это как вердикт: разница, которую вы ищете, слишком мала для вашего объёма. Вместо этого тестируйте более крупный сдвиг — другой hook or angle, другую структуру воронки — где обнаруживаемая разница велика, а выборка доступна.
Не подглядывайте — или хотя бы не действуйте на подглядывания#
Классический сценарий провала: проверяете дашборд ежедневно и объявляете победу в первый день, когда цифры выглядят значимыми. Повторные взгляды на нарастающие данные резко повышают количество ложноположительных результатов — при ежедневном подглядывании правило «остановиться, когда достигнута значимость» срабатывает гораздо чаще, чем заявленная ошибка 5 %. Регрессия к среднему затем объясняет большинство жалоб «мой победитель перестал выигрывать»: вариант, который резко вырвался вперёд во второй день, ехал на шуме, и со временем возвращается к среднему. Дисциплина проста: заранее фиксируйте размер выборки, проверяйте ежедневно только условия стоп‑лосса — поломка трекинга, неконтролируемый рост расходов, катастрофическое падение варианта — и оценивайте победителя один раз, в конце.
Правила прекращения, когда вы не можете позволить себе значимость#
Большинство native‑ и affiliate‑покупателей не могут финансировать 12 500 кликов на вариант, и притворяться иначе приводит к фальшивой строгости. Честная альтернатива — поэтапное отсеивание, более грубое, чем тестирование на значимости, и стандартная практика среди покупателей, тестирующих десятки креативов в месяц:
- Отсеивание по CTR (дни 1–3). Дайте каждому креативу несколько тысяч показов, затем убейте всё, что явно отстаёт от пакета. Вы ничего не доказываете — просто триажируете, чтобы бюджет сосредоточился на потенциальных победителях.
- Ограничитель расходов (скользящий). Распространённое правило практикующих: приостановите любой вариант, который потратил 2–3× ваш целевой CPA без конверсий. Это не статистика, а выживание.
- Тестирование на значимости среди финалистов. Как только два‑три выживших захватывают большую часть расходов, проведите полноценный тест на уровне конверсии между ними, используя расчёт выше. Вы финансируете один реальный тест вместо десяти фиктивных.
Укоротите выборку: начинайте с объявлений, уже прошедших отбор#
Каждый вариант, который вам не нужно тестировать, — это сэкономленные деньги, а самая дешевая информация о том, что работает, — это то, за что конкуренты продолжают платить. Объявление, работавшее более 30 дней, каждый день проходило проверку прибыльности своего владельца. Индекс OpenAdLibrary, включающий более 725 000 живых native‑креативов в 49 сетях (июнь 2026), фиксирует даты первого и последнего появления каждого креатива, превращая ad longevity в фильтруемый сигнал, а не в догадку — longest-running native ads в вашей вертикали представляют собой предварительно проверенную стартовую решётку. Стройте тест вокруг двух‑трёх angles already proven in the wild и вы тестируете варианты уже победителя, а не холодные догадки; вы можете бесплатно просматривать живые креативы конкурентов с помощью native ad research tool. Меньше, но лучше варианты означают меньшую выборку, более короткие тесты и меньше бюджета, сгоревшего на поиск.
Пример из практики, от начала до конца#
Предположим, вы продвигаете оффер с выплатой $60 за лид, имея одну кампанию, генерирующую примерно 1 500 кликов в день по вашим тестовым ячейкам.
- Этап креатива: четыре креатива конкурируют на уровне CTR. По несколько тысяч показов каждый решается за 2–3 дня; отсекаете до двух лучших.
- Этап лендеров: два лендерa на уровне конверсии. Базовый CVR около 3 %, обнаружение 30 % относительного прироста (0,9 п.п. абсолютного): n ≈ 16 × 0.03 × 0.97 ÷ 0.009² ≈ 5 700 кликов на вариант, около 11 400 в сумме. При 1 500 кликах в день это восемь дней — условно полная неделя плюс покрытие выходных.
- Вердикт: один цикл теста занимает 10–12 дней от запуска до обоснованного победителя, при этом расходы на проигравшие ограничены правилом‑ограничителем, а не продолжаются в надежде.
Это реалистичная картина «как долго»: несколько дней дешевого триажа, неделя‑плюс фокусированного измерения и календарная длительность, определяемая вашим объёмом кликов — а не магическим числом дней.







