OpenAdLibraryOpenAdLibrary
Креатив та воронки

Як довго проводити A/B-тестування оголошень: практичне застосування математики вибірки

Тривалість A/B-тесту — це арифметика, а не фольклор: необхідний розмір вибірки поділити на щоденний обсяг. Ось математика вибірки, зведена до практичного застосування, плюс мінімальні та максимальні обмеження та правила зупинки, які роблять тести доступними.

Ілюстрація до статті: Як довго проводити A/B-тестування оголошень: практичне застосування математики вибірки

Проводьте A/B-тестування оголошень доти, доки кожен варіант не збере достатньо конверсій, щоб різниця, яка вас цікавить, стала видимою — а не фіксовану кількість днів. Як практичне правило, це означає щонайменше один повний тиждень для охоплення циклів дня тижня та від 50 до кількох тисяч конверсій на варіант залежно від того, наскільки малу різницю ви хочете виявити. Тривалість — це результат арифметики, а не календарних уподобань: необхідні дні = необхідний розмір вибірки на варіант ÷ ваш щоденний обсяг на варіант. Ця стаття дає вам цю арифметику, мінімальні та максимальні обмеження, які її перевизначають, та дешевшу послідовність тестування, яку слід використовувати, коли математика каже, що ви не можете дозволити собі статистичну значущість.

Тривалість — це результат, а не календарний вибір#

Більшість порад дає вам фіксовану відповідь — сім днів, чотирнадцять днів, місяць. Дні — це неправильна одиниця. Кампанія, яка генерує 40 конверсій на день, вирішить тест лендінгу приблизно за тиждень; той самий тест для кампанії з 4 конверсіями на день займе понад два місяці, до якого часу результат буде забруднений усім, що змінилося за цей період. Три вхідні параметри визначають вашу реальну тривалість:

  • Базовий рівень метрики, яку ви тестуєте — CTR для креативів, конверсійність для лендінгів та оферів.
  • Найменша різниця, яку варто виявити. Виявлення підйому на 10% коштує набагато більше трафіку, ніж виявлення підйому на 50%, і більшість невеликих підйомів не варті витрат, необхідних для їх виявлення.
  • Щоденний обсяг на варіант — визначається вашим бюджетом та ставками.

Зафіксуйте перші два параметри, і необхідний розмір вибірки випливає з формули. Поділіть на третій параметр, і ви отримаєте свою тривалість. Якщо відповідь виходить довшою за чотири тижні, правильним кроком зазвичай є зміна тесту, а не його продовження — детальніше про це нижче.

Математика вибірки без ступеня зі статистики#

Стандартний ярлик для тесту з двома варіантами при 95% довірчому рівні та 80% потужності:

n на варіант ≈ 16 × p × (1 − p) ÷ d²

де p — ваш базовий рівень у десятковому вигляді, а d — абсолютна різниця, яку ви хочете виявити. Два приклади розрахунків:

  • Тест креативу на рівні CTR. Базовий CTR 0.5%, виявлення відносного підйому на 20% (0.1 пунктів абсолютно): n ≈ 16 × 0.005 × 0.995 ÷ 0.001² ≈ 80,000 імпресій на варіант. Нативні розміщення подають імпресії швидко та дешево, тому це може вирішитися за дні.
  • Тест лендінгу на рівні конверсій. Базова конверсійність 2%, виявлення відносного підйому на 25% (0.5 пунктів абсолютно): n ≈ 16 × 0.02 × 0.98 ÷ 0.005² ≈ 12,500 кліків на варіант. При CPC $0.40 це п'ятизначний тест для однієї пари сторінок.
Що ви тестуєте Базовий рівень Підйом для виявлення Вибірка на варіант
CTR (креатив) 0.5% 20% відносно ~80,000 імпресій
CTR (креатив) 0.5% 50% відносно ~13,000 імпресій
CVR (лендінг) 2% 25% відносно ~12,500 кліків
CVR (лендінг) 2% 50% відносно ~3,100 кліків
CVR (сторінка оферу) 5% 25% відносно ~4,900 кліків

З цієї таблиці випливають два уроки. По-перше, невеликі підйоми жахливо дорогі: зменшення виявлюваної різниці вдвічі збільшує вибірку вчетверо. По-друге, тестування на рівні імпресій коштує невелику частку від тестування на рівні кліків. Ця асиметрія має формувати всю вашу програму тестування: тестуйте креативні підходи на рівні CTR, тестуйте воронки на рівні конверсій, і не тестуйте зміни розміру кольору кнопки взагалі — вибірка, необхідна для їх виявлення, рідко окупається.

Мінімум: один повний тиждень, незалежно від математики#

Навіть якщо обсяг дає вашу вибірку за два дні, проводьте щонайменше сім. Аудиторія буднів та вихідних поводиться по-різному — різні люди, різні пристрої, різна наміреність. Мікс видавців у нативних мережах змінюється протягом тижня з новинними циклами та розкладами контенту, тому трафік вівторка — це не трафік суботи. Затримка конверсії додає друге упередження: кліки на варіант у четвер можуть конвертуватися в суботу, тому раннє відсічення систематично надає перевагу тому варіанту, який випадково отримав свої імпресії першим. Тест, який закінчується в середині тижня, відібрав упереджений зріз вашого реального трафіку, і «переможець» може бути просто спеціалістом буднів.

Максимум: довгі тести гниють зсередини#

Після трьох-чотирьох тижнів A/B-тест перестає бути контрольованим експериментом. Втома креативу погіршує обидва варіанти — рідко з однаковою швидкістю, що тихо змінює рейтинги під час тесту. Конкуренти входять та виходять з аукціону і змінюють якість вашого трафіку. Сезонність поступово змінюється під усім порівнянням. Якщо формула каже, що вам потрібно шість тижнів трафіку, сприймайте це як вердикт: різниця, на яку ви полюєте, занадто мала, щоб її виявити при вашому обсязі. Краще протестуйте більш радикальну зміну — інший хук чи підхід, іншу структуру воронки — де виявлювана різниця велика, а вибірка доступна.

Не підглядайте — або принаймні не дійте на основі підглядів#

Класичний режим невдачі: щодня перевіряйте панель керування та оголошуйте перемогу в перший день, коли цифри виглядають значущими. Повторні перегляди накопичуваних даних різко збільшують частоту хибнопозитивних результатів — при щоденному підгляданні правило зупинки «воно досягло значущості в якийсь момент» спрацьовує набагато частіше, ніж заявлена 5% частота помилок. Регресія до середнього потім пояснює більшість скарг «мій переможець перестав перемагати»: варіант, який вирвався вперед другого дня, їхав на шумі, і він повертається назад. Дисципліна проста: заздалегідь визначте розмір вибірки, відстежуйте щодня лише умови стоп-лоссу — зламане відстеження, неконтрольовані витрати, катастрофічна результативність варіанта — та оцінюйте переможця один раз, в кінці.

Правила зупинки для випадків, коли ви не можете дозволити собі значущість#

Більшість нативних та афілійних баєрів не можуть фінансувати 12,500 кліків на варіант, а прикидання іншого породжує фальшиву строгість. Чесною альтернативою є поетапне відсіювання — грубіше, ніж тестування значущості, і стандартна практика серед баєрів, які тестують десятки креативів на місяць:

  1. Відсіювання за CTR (дні 1–3). Дайте кожному креативу кілька тисяч імпресій, потім припиніть все, що явно нижче за групу. Ви нічого не доводите — ви проводите тріаж, щоб бюджет зосередився на потенційних переможцях.

  2. Обмеження за витратами (поточне). Поширене практичне правило: призупиніть будь-який варіант, який витратив у 2–3 рази більше за вашу цільову CPA без жодної конверсії. Це не статистика; це виживання.

  3. Значущість для фіналістів. Коли два або три варіанти, що залишилися, несуть основну частину витрат, проведіть належний тест на рівні конверсій між ними, використовуючи математику вище. Ви фінансуєте один реальний тест замість десяти фальшивих.

Скорочуйте вибірку: починайте з оголошень, які вже вижили#

Кожен варіант, який вам не потрібно тестувати, — це заощаджені гроші, а найдешевша інформація про те, що працює, — це те, за що конкуренти продовжують платити. Оголошення, яке працювало 30+ днів, щодня проходило перевірку рентабельності свого власника. Індекс OpenAdLibrary з понад 725,000 живих нативних креативів у 49 мережах (червень 2026 року) фіксує дати першого та останнього перегляду для кожного креативу, що перетворює довговічність оголошення на фільтрований сигнал, а не на здогадку — найдовші нативні оголошення у вашій вертикалі є попередньо протестованою стартовою сіткою. Побудуйте свій тест навколо двох-трьох підходів, уже доведених на практиці, і ви тестуватимете варіації переможця, а не холодні здогадки; ви можете безкоштовно переглядати живі креативи конкурентів за допомогою інструменту дослідження нативних оголошень. Менша кількість кращих варіантів означає менші вибірки, коротші тести та менше бюджету, спаленого на відкриття.

Практичний приклад від початку до кінця#

Припустимо, ви запускаєте офер з лідоґенерацією з виплатою $60 з однією кампанією, яка дає приблизно 1,500 кліків на день по ваших тестових групах.

  • Етап креативів: чотири креативи змагаються на рівні CTR. Кілька тисяч імпресій на кожен вирішується за 2–3 дні; відсійте до двох найкращих.
  • Етап лендінгу: два лендінги на рівні конверсій. Базова CVR близько 3%, виявлення відносного підйому на 30% (0.9 пунктів абсолютно): n ≈ 16 × 0.03 × 0.97 ÷ 0.009² ≈ 5,700 кліків на варіант, приблизно 11,400 всього. При 1,500 кліків на день це вісім днів — назвемо це повним тижнем плюс охоплення вихідних.
  • Вердикт: один цикл тестування триває 10–12 днів від запуску до обґрунтованого переможця, причому програшні витрати обмежені правилом обмеження, а не залишені працювати на надії.

Ось реалістична форма «як довго»: кілька днів дешевого тріажу, тиждень-плюс зосередженого вимірювання та календарна тривалість, визначена вашим обсягом кліків — а не чиїмось магічним числом днів.

Часті питання

Скільки конверсій потрібно на варіант у A/B-тесті оголошень?
Як практичне правило, 50–100 конверсій на варіант дозволяють виявити великі відмінності (30%+ відносно) з розумною впевненістю, тоді як для виявлення невеликих підйомів на 10–15% можуть знадобитися тисячі. Формула n ≈ 16 × p(1−p) ÷ d² дає точне число для вашого базового рівня та різниці, яку ви хочете виявити. Якщо ваш обсяг не дозволяє досягти цього приблизно за чотири тижні, краще протестувати більш радикальну зміну креативу.
Чи достатньо 3 днів для проведення A/B-тесту оголошень?
Ні. Навіть якщо кампанія з високим обсягом збирає велику вибірку за три дні, ви відібрали лише частину тижневого циклу — аудиторія буднів та вихідних конвертує по-різному, а затримка конверсії означає, що ранні кліки ще не завершили конверсію. Проводьте тест щонайменше сім повних днів. Виняток — раннє відсіювання за CTR, коли ви відсіюєте явних аутсайдерів, а не оголошуєте статистично валідного переможця.
Чи слід тестувати оголошення за CTR чи за конверсійністю?
За обома показниками, на різних етапах. Тести на рівні CTR потребують лише імпресій, які дешеві та швидкі, тому використовуйте їх для раннього відсіювання слабких креативів. Тести на конверсійність вимірюють те, за що вам реально платять, але потребують у 10–100 разів більшого бюджету, тому залиште їх для фіналістів та змін лендінгу чи воронки. Тестування всього на рівні конверсій — це спосіб, яким невеликі акаунти спалюють бюджет на строгість, яку не можуть собі дозволити.
Що станеться, якщо я зупиню A/B-тест одразу, як тільки він досягне статистичної значущості?
Ви різко збільшите частоту хибнопозитивних результатів. Щоденна перевірка та зупинка при першому значущому показнику означає, що багато «переможців» — це статистичний шум, який регресував би з більшими даними — класична проблема підглядання. Заздалегідь визначте розмір вибірки, використовуйте щоденні перевірки лише для стоп-лосс умов, таких як зламане відстеження або неконтрольовані витрати, та оцінюйте результат один раз, коли вибірка буде повною.
Чому мій переможний варіант оголошення перестав перемагати після тесту?
Зазвичай це регресія до середнього: раннє лідерство варіанта містило елемент удачі, і його довгострокова результативність наближається до середньої. До цього додається втома креативу — свіжий переможець погіршується, коли аудиторія бачить його повторно. Обидві причини пояснюють, чому слід періодично перетестовувати чемпіонів та розглядати будь-який окремий результат тесту як оцінку з межею похибки, а не як постійний факт.
Команда OpenAdLibrary
АвторКоманда OpenAdLibrary
Дослідження нативної реклами та ad intelligence

Ми створюємо OpenAdLibrary — відкриту платформу для прозорості реклами. Щодня наші системи збирають живі нативні оголошення на Taboola, Outbrain, MGID, Revcontent, Teads, Yahoo та MSN, ідентифікують справжнього рекламодавця за кожним з них і відстежують клік до цільової сторінки. Ці гайди концентрують наші спостереження з цих даних, щоб ви могли досліджувати ринок швидше.