OpenAdLibraryOpenAdLibrary
Креативы и воронки продаж

Как долго проводить A/B‑тесты рекламных объявлений: практический расчёт размера выборки

Продолжительность A/B‑теста – это арифметика, а не народная мудрость: требуемая выборка делится на ежедневный объём. Здесь представлен практический расчёт размера выборки, а также «полы», «потолки» и правила прекращения, позволяющие держать тесты в рамках бюджета.

Редакционная иллюстрация: Как долго проводить A/B‑тесты рекламных объявлений: практический расчёт размера выборки

Проводите A/B‑тест рекламного объявления до тех пор, пока каждый вариант не соберёт достаточно конверсий, чтобы разница, которая вас интересует, стала видимой — а не фиксированное количество дней. Как практическое правило, это означает минимум одну полную неделю, чтобы покрыть суточные циклы, и от 50 до нескольких тысяч конверсий на вариант в зависимости от того, насколько небольшую разницу вы хотите обнаружить. Продолжительность — это результат арифметики, а не предпочтение календаря: дни = требуемая выборка на вариант ÷ ваш ежедневный объём на вариант. Эта статья предоставляет вам эту арифметику, «полы» и «потолки», которые её переопределяют, и более экономичную последовательность тестирования, когда расчёт показывает, что вы не можете позволить себе значимость.

Продолжительность — это результат, а не календарный выбор#

Большинство рекомендаций дают фиксированный ответ — семь дней, четырнадцать дней, месяц. Дни — неверная единица измерения. Кампания, генерирующая 40 конверсий в день, решает тест посадочной страницы примерно за неделю; тот же тест в кампании с 4 конверсиями в день займёт более двух месяцев, к чему результат будет уже искажён всеми изменениями за это время. Три входных параметра определяют реальную продолжительность:

  • Базовый уровень метрики, которую вы тестируете — CTR для креативов, conversion rate для посадочных страниц и офферов.
  • Наименьшее различие, которое стоит обнаружить. Обнаружение 10 % прироста требует гораздо больше трафика, чем обнаружение 50 % прироста, и большинство небольших приростов не оправдывают затраты на их выявление.
  • Ежедневный объём на вариант — задаётся вашим бюджетом и ставками.

Зафиксируйте первые два параметра, и требуемая выборка вытекает из формулы. Разделите её на третий параметр — получите продолжительность. Если полученный результат превышает примерно четыре недели, правильным шагом обычно будет изменение теста, а не его «выживание» — подробнее ниже.

Расчёт размера выборки без степени статистики#

Стандартный упрощённый расчёт для двухвариантного теста при 95 % надёжности и 80 % мощности:

n per variant ≈ 16 × p × (1 − p) ÷ d²

где p — ваш базовый уровень в виде десятичной дроби, а d — абсолютная разница, которую хотите обнаружить. Два примера расчётов:

  • Тест креатива на уровне CTR. Базовый CTR 0,5 %, обнаружение 20 % относительного прироста (0,1 п.п. абсолютного): n ≈ 16 × 0.005 × 0.995 ÷ 0.001² ≈ 80 000 показов на вариант. Native‑размещения показывают имппрессионы быстро и дешево, поэтому такой тест решается за дни.
  • Тест посадочной страницы на уровне конверсии. Базовый коэффициент конверсии 2 %, обнаружение 25 % относительного прироста (0,5 п.п. абсолютного): n ≈ 16 × 0.02 × 0.98 ÷ 0.005² ≈ 12 500 кликов на вариант. При стоимости $0.40 CPC это уже пятизначный тест для одной пары страниц.
Что тестируется Базовый уровень Прирост для обнаружения Выборка на вариант
CTR (креатив) 0.5% 20% относительный ~80 000 показов
CTR (креатив) 0.5% 50% относительный ~13 000 показов
CVR (лендер) 2% 25% относительный ~12 500 кликов
CVR (лендер) 2% 50% относительный ~3 100 кликов
CVR (страница оффера) 5% 25% относительный ~4 900 кликов

Из этой таблицы вытекают два вывода. Во‑первых, небольшие приросты чрезвычайно дороги: уменьшение обнаруживаемой разницы вдвое приводит к увеличению выборки в четыре раза. Во‑вторых, тестирование на уровне показов стоит лишь малой части от тестирования на уровне кликов. Эта асимметрия должна формировать всю вашу программу тестирования: тестируйте креативные углы на уровне CTR, тестируйте воронки на уровне конверсии и вовсе не тестируйте изменения типа «цвет кнопки», поскольку требуемая выборка для их обнаружения почти никогда не окупается.

Пол: минимум одна полная неделя, независимо от расчётов#

Даже если объём доставляет вашу выборку за два дня, запускайте тест минимум семь дней. Аудитории в будние и выходные дни ведут себя по‑разному — разные люди, разные устройства, разный намерения. Смесь издателей в native‑сетях меняется в течение недели в зависимости от новостных циклов и расписания контента, поэтому трафик во вторник не равен трафику в субботу. Задержка конверсии добавляет второе искажение: клики варианта в четверг могут конвертироваться в субботу, поэтому раннее обрезание систематически отдаёт предпочтение тому варианту, который получил показы первым. Тест, завершающийся в середине недели, охватывает лишь искажённый срез вашего реального трафика, и «победитель» может оказаться просто специалистом по буднему дню.

Потолок: длительные тесты «гниют» изнутри#

После трёх‑четырёх недель A/B‑тест перестаёт быть контролируемым экспериментом. Creative fatigue уменьшает эффективность обоих вариантов — редко одинаково, что тихо меняет ранжирование в середине теста. Конкуренты входят и выходят из аукциона, меняя качество вашего трафика. Сезонность смещает всё сравнение. Если формула требует шести недель трафика, воспринимайте это как вердикт: разница, которую вы ищете, слишком мала для вашего объёма. Вместо этого тестируйте более крупный сдвиг — другой hook or angle, другую структуру воронки — где обнаруживаемая разница велика, а выборка доступна.

Не подглядывайте — или хотя бы не действуйте на подглядывания#

Классический сценарий провала: проверяете дашборд ежедневно и объявляете победу в первый день, когда цифры выглядят значимыми. Повторные взгляды на нарастающие данные резко повышают количество ложноположительных результатов — при ежедневном подглядывании правило «остановиться, когда достигнута значимость» срабатывает гораздо чаще, чем заявленная ошибка 5 %. Регрессия к среднему затем объясняет большинство жалоб «мой победитель перестал выигрывать»: вариант, который резко вырвался вперёд во второй день, ехал на шуме, и со временем возвращается к среднему. Дисциплина проста: заранее фиксируйте размер выборки, проверяйте ежедневно только условия стоп‑лосса — поломка трекинга, неконтролируемый рост расходов, катастрофическое падение варианта — и оценивайте победителя один раз, в конце.

Правила прекращения, когда вы не можете позволить себе значимость#

Большинство native‑ и affiliate‑покупателей не могут финансировать 12 500 кликов на вариант, и притворяться иначе приводит к фальшивой строгости. Честная альтернатива — поэтапное отсеивание, более грубое, чем тестирование на значимости, и стандартная практика среди покупателей, тестирующих десятки креативов в месяц:

  1. Отсеивание по CTR (дни 1–3). Дайте каждому креативу несколько тысяч показов, затем убейте всё, что явно отстаёт от пакета. Вы ничего не доказываете — просто триажируете, чтобы бюджет сосредоточился на потенциальных победителях.
  2. Ограничитель расходов (скользящий). Распространённое правило практикующих: приостановите любой вариант, который потратил 2–3× ваш целевой CPA без конверсий. Это не статистика, а выживание.
  3. Тестирование на значимости среди финалистов. Как только два‑три выживших захватывают большую часть расходов, проведите полноценный тест на уровне конверсии между ними, используя расчёт выше. Вы финансируете один реальный тест вместо десяти фиктивных.

Укоротите выборку: начинайте с объявлений, уже прошедших отбор#

Каждый вариант, который вам не нужно тестировать, — это сэкономленные деньги, а самая дешевая информация о том, что работает, — это то, за что конкуренты продолжают платить. Объявление, работавшее более 30 дней, каждый день проходило проверку прибыльности своего владельца. Индекс OpenAdLibrary, включающий более 725 000 живых native‑креативов в 49 сетях (июнь 2026), фиксирует даты первого и последнего появления каждого креатива, превращая ad longevity в фильтруемый сигнал, а не в догадку — longest-running native ads в вашей вертикали представляют собой предварительно проверенную стартовую решётку. Стройте тест вокруг двух‑трёх angles already proven in the wild и вы тестируете варианты уже победителя, а не холодные догадки; вы можете бесплатно просматривать живые креативы конкурентов с помощью native ad research tool. Меньше, но лучше варианты означают меньшую выборку, более короткие тесты и меньше бюджета, сгоревшего на поиск.

Пример из практики, от начала до конца#

Предположим, вы продвигаете оффер с выплатой $60 за лид, имея одну кампанию, генерирующую примерно 1 500 кликов в день по вашим тестовым ячейкам.

  • Этап креатива: четыре креатива конкурируют на уровне CTR. По несколько тысяч показов каждый решается за 2–3 дня; отсекаете до двух лучших.
  • Этап лендеров: два лендерa на уровне конверсии. Базовый CVR около 3 %, обнаружение 30 % относительного прироста (0,9 п.п. абсолютного): n ≈ 16 × 0.03 × 0.97 ÷ 0.009² ≈ 5 700 кликов на вариант, около 11 400 в сумме. При 1 500 кликах в день это восемь дней — условно полная неделя плюс покрытие выходных.
  • Вердикт: один цикл теста занимает 10–12 дней от запуска до обоснованного победителя, при этом расходы на проигравшие ограничены правилом‑ограничителем, а не продолжаются в надежде.

Это реалистичная картина «как долго»: несколько дней дешевого триажа, неделя‑плюс фокусированного измерения и календарная длительность, определяемая вашим объёмом кликов — а не магическим числом дней.

Часто задаваемые вопросы

Сколько конверсий мне нужно собрать на каждый вариант в A/B‑тесте рекламного объявления?
Как практическое правило, 50–100 конверсий на вариант позволяют обнаружить крупные различия (30 % + относительно) с приемлемой уверенностью, тогда как небольшие приросты 10–15 % могут потребовать тысячи конверсий. Формула n ≈ 16 × p(1−p) ÷ d² даёт точное число для вашего базового уровня и желаемой разницы. Если ваш объём не позволяет достичь этого за примерно четыре недели, вместо этого тестируйте более значительный креативный сдвиг.
Достаточно ли 3 дня для проведения A/B‑теста рекламного объявления?
Нет. Даже если кампания с высоким объёмом собирает большую выборку за три дня, вы охватываете лишь часть недельного цикла — аудитории в будние и выходные дни конвертируются по‑разному, а задержка конверсий означает, что ранние клики ещё не завершились. Запускайте тест минимум семь полных дней. Исключение составляет раннее отсеивание по CTR, когда вы просто отбрасываете очевидных проигравших, а не объявляете статистически обоснованного победителя.
Стоит ли тестировать объявления по CTR или по коэффициенту конверсии?
Оба показателя, но на разных этапах. Тесты на уровне CTR требуют лишь показов, которые дешёвы и быстры, поэтому их используют для раннего отсеивания слабых креативов. Тесты на уровне конверсии измеряют то, за что вы действительно платите, но требуют в 10–100 раз большего бюджета, поэтому их оставляют для финалистов и для изменений посадочных страниц или воронки. Тестировать всё на уровне конверсии — это то, как небольшие аккаунты сжигают бюджет, пытаясь достичь уровня строгости, который они не могут позволить.
Что происходит, если я останавливаю A/B‑тест, как только он достигает значимости?
Вы резко повышаете уровень ложноположительных результатов. Ежедневные проверки и остановка при первом значимом показателе означают, что многие «победители» являются шумом, который бы исчез при большем объёме данных — классическая проблема «подглядывания». Заранее фиксируйте размер выборки, используйте ежедневные проверки только для условий стоп‑лосса, таких как поломка трекинга или неконтролируемый рост расходов, и оценивайте результат один раз, когда выборка завершена.
Почему мой победный вариант объявления перестал выигрывать после теста?
Обычно это регрессия к среднему: раннее преимущество варианта было обусловлено удачей, а его долгосрочная эффективность ближе к среднему. Усталость креатива усиливает эффект — победитель теряет эффективность, когда аудитория видит его многократно. Оба фактора являются причинами периодически пере‑тестировать победителей и рассматривать любой отдельный результат как оценку с погрешностью, а не как окончательную истину.
Команда OpenAdLibrary
АвторКоманда OpenAdLibrary
Рекламная аналитика и исследование нативной рекламы

Мы создаём OpenAdLibrary — открытую платформу для прозрачности рекламы. Ежедневно наши системы собирают живые нативные объявления в Taboola, Outbrain, MGID, Revcontent, Teads, Yahoo и MSN, определяют реального рекламодателя за каждым из них и отслеживают клик до целевой страницы. Эти руководства концентрируют наши наблюдения из этих данных, чтобы вы могли быстрее исследовать рынок.