OpenAdLibraryOpenAdLibrary
Kreatywność Reklamowa i Lejki Sprzedaży

Jak długo prowadzić testy A/B reklam: Praktyczne obliczenia wielkości próby

Czas trwania testu A/B to arytmetyka, nie folklor: wymagana próba podzielona przez dzienny wolumen. Oto praktyczne obliczenia wielkości próby, plus limity dolne, górne i zasady zakończenia, które utrzymują testy w przystępnych kosztach.

Ilustracja redakcyjna: Jak długo prowadzić testy A/B reklam: Praktyczne obliczenia wielkości próby

Przeprowadzaj test A/B reklamy, dopóki każdy wariant nie zgromadzi wystarczającej liczby konwersji, aby różnica, na której Ci zależy, stała się widoczna — nie przez określoną liczbę dni. Jako zasada praktyczna oznacza to co najmniej pełny tydzień, aby objąć cykle dni tygodnia, oraz od 50 do kilku tysięcy konwersji na wariant, w zależności od tego, jak małą różnicę chcesz wykryć. Czas trwania jest wynikiem arytmetyki, nie preferencją kalendarzową: dni potrzebne = wymagana próba na wariant ÷ Twój dzienny wolumen na wariant. Ten artykuł podaje tę arytmetykę, limity dolne i górne, które ją nadpisują, oraz tańszą sekwencję testowania, gdy matematyka wskazuje, że nie stać Cię na istotność.

Czas trwania jest wynikiem, nie wyborem kalendarzowym#

Większość porad daje stałą odpowiedź — siedem dni, czternaście dni, miesiąc. Dni są niewłaściwą jednostką. Kampania generująca 40 konwersji dziennie rozwiązuje test landing page w około tydzień; ten sam test przy kampanii generującej 4 dziennie zajmuje ponad dwa miesiące, a w tym czasie wynik zostaje skażony wszystkim, co się zmieniło. Trzy czynniki decydują o rzeczywistym czasie trwania:

  • Podstawowa stopa mierzonej metryki — CTR dla kreacji, współczynnik konwersji dla landingów i ofert.
  • Najmniejsza różnica warta wykrycia. Wykrycie 10% podwyżki kosztuje znacznie więcej ruchu niż wykrycie 50% podwyżki, a większość małych podwyżek nie jest warta wydatków potrzebnych do ich zobaczenia.
  • Dzienny wolumen na wariant — określony przez budżet i stawki.

Ustal pierwsze dwa, a wymagana próba wypływa z wzoru. Podziel przez trzeci i otrzymasz czas trwania. Jeśli wynik jest dłuższy niż około cztery tygodnie, prawidłowym ruchem jest zwykle zmiana testu, a nie przedłużanie go — więcej o tym poniżej.

Matematyka wielkości próby, bez stopnia statystyki#

Standardowy skrót dla testu dwuwariantowego przy 95% pewności i 80% mocy:

n na wariant ≈ 16 × p × (1 − p) ÷ d²

gdzie p to Twoja podstawowa stopa wyrażona jako ułamek, a d to bezwzględna różnica, którą chcesz wykryć. Dwa przykłady:

  • Test kreacji na poziomie CTR. Podstawowy CTR 0,5%, wykrycie 20% względnego wzrostu (0,1 punktu bezwzględnego): n ≈ 16 × 0,005 × 0,995 ÷ 0,001² ≈ 80 000 wyświetleń na wariant. Natywne miejsca publikacji dostarczają wyświetleń szybko i tanio, więc można to rozwiązać w ciągu kilku dni.
  • Test landingu na poziomie konwersji. Podstawowy współczynnik konwersji 2%, wykrycie 25% względnego wzrostu (0,5 punktu bezwzględnego): n ≈ 16 × 0,02 × 0,98 ÷ 0,005² ≈ 12 500 kliknięć na wariant. Przy CPC $0.40 to test pięciocyfrowy dla jednej pary stron.
Co testujesz Podstawa Wykrywany lift Próbka na wariant
CTR (kreacja) 0.5% 20% względnie ~80,000 wyświetleń
CTR (kreacja) 0.5% 50% względnie ~13,000 wyświetleń
CVR (landing) 2% 25% względnie ~12,500 kliknięć
CVR (landing) 2% 50% względnie ~3,100 kliknięć
CVR (strona oferty) 5% 25% względnie ~4,900 kliknięć

Dwie lekcje wypływają z tej tabeli. Po pierwsze, małe podwyżki są brutalnie kosztowne: zmniejszenie wykrywalnej różnicy o połowę czterokrotnie zwiększa wymaganą próbę. Po drugie, testowanie na poziomie wyświetleń kosztuje niewielką część tego, co testowanie na poziomie kliknięć. Ta asymetria powinna kształtować cały Twój program testowy: testuj kąty kreatywne na poziomie CTR, testuj lejki na poziomie konwersji i nie testuj zmian rozmiaru przycisku — próbka potrzebna do ich wykrycia rzadko się zwraca.

Limit dolny: pełny tydzień, niezależnie od wyniku matematyki#

Nawet gdy wolumen dostarczy Twoją próbkę w dwa dni, przeprowadzaj test przynajmniej przez siedem dni. Odbiorcy w dni robocze i weekendy zachowują się inaczej — różni ludzie, różne urządzenia, różna intencja. Mieszanka wydawców w sieciach natywnych rotuje w ciągu tygodnia wraz z cyklami wiadomości i harmonogramami treści, więc ruch we wtorek nie jest tym samym, co w sobotę. Opóźnienie konwersji dodaje drugi bias: kliknięcia wariantu w czwartek mogą konwertować w sobotę, więc wczesne odcięcie systematycznie faworyzuje wariant, który otrzymał wyświetlenia jako pierwszy. Test kończący się w połowie tygodnia próbuje skośną część rzeczywistego ruchu, a „zwycięzca” może po prostu być specjalistą od dni roboczych.

Limit górny: długie testy psują się od środka#

Po trzech‑czterech tygodniach test A/B przestaje być kontrolowanym eksperymentem. Zmęczenie kreatywne osłabia oba warianty — rzadko w tym samym tempie, co cicho odwraca rankingi w trakcie testu. Konkurenci wchodzą i wychodzą z aukcji, zmieniając jakość Twojego ruchu. Sezonowość dryfuje pod całą porównawczą ramą. Jeśli wzór wskazuje, że potrzebujesz sześciu tygodni ruchu, odczytaj to jako werdykt: różnica, której szukasz, jest zbyt mała, by ją wykryć przy Twoim wolumenie. Zamiast tego przetestuj większy obrót — inny hook lub angle, inną strukturę lejka — gdzie wykrywalna różnica jest duża, a próbka przystępna.

Nie podglądaj — albo przynajmniej nie reaguj na podglądy#

Klasyczny tryb awaryjny: codziennie sprawdzasz dashboard i ogłaszasz zwycięstwo w pierwszym dniu, gdy liczby wyglądają na istotne. Wielokrotne spojrzenia na rosnące dane dramatycznie zwiększają fałszywe trafienia — przy codziennym podglądzie reguła „osiągnęło istotność w pewnym momencie” uruchamia się znacznie częściej niż reklamowany 5% poziom błędu. Regresja do średniej wyjaśnia potem większość skarg „mój zwycięzca przestał wygrywać”: wariant, który wyprzedził w drugim dniu, jechał na szumie i wraca do normy. Dyscyplina jest prosta: zobowiąż się do wielkości próby, monitoruj codziennie wyłącznie w sytuacjach stop‑loss — zepsuty tracking, niekontrolowane wydatki, wariant katastrofalnie słaby — i oceniaj zwycięzcę raz, na koniec.

Zasady zakończenia, gdy nie stać Cię na istotność#

Większość nabywców natywnych i afiliacyjnych nie może sfinansować 12 500 kliknięć na wariant, a udawanie, że tak, generuje fałszywą rygorystyczność. Uczciwą alternatywą jest etapowe odrzucanie — mniej precyzyjne niż testowanie istotności, a standardowa praktyka wśród nabywców testujących dziesiątki kreacji miesięcznie:

  1. Odcięcie CTR (dni 1–3). Daj każdej kreacji kilka tysięcy wyświetleń, potem usuń wszystko wyraźnie poniżej średniej. Nie dowodzisz niczego — triageujesz, aby budżet skoncentrował się na prawdopodobnych zwycięzcach.
  2. Guardrail wydatków (rolling). Powszechna reguła praktyków: wstrzymaj każdy wariant, który wydał 2–3× Twój docelowy CPA przy zerowych konwersjach. To nie statystyka; to przetrwanie.
  3. Istotność na finalistach. Gdy dwaj lub trzej ocalałe warianty pochłaniają większość wydatków, przeprowadź właściwy test na poziomie konwersji między nimi, używając powyższej matematyki. Sfinansujesz jeden prawdziwy test zamiast dziesięciu fałszywych.

Skróć próbkę: zacznij od reklam, które już przetrwały#

Każdy wariant, którego nie musisz testować, to zaoszczędzone pieniądze, a najtańszą informacją o tym, co działa, jest to, co konkurenci nadal płacą, aby uruchomić. Reklama, która działała ponad 30 dni, przeszła codziennie kontrolę rentowności właściciela. Indeks OpenAdLibrary obejmujący ponad 725 000 aktywnych natywnych kreacji w 49 sieciach (czerwiec 2026) rejestruje daty pierwszego i ostatniego widzenia każdej kreacji, co zamienia długowieczność reklamy w filtrujący sygnał, a nie w przeczucie — najdłużej działające natywne reklamy w Twojej branży to wstępnie przetestowana siatka startowa. Buduj test wokół dwóch lub trzech kątów już udowodnionych w praktyce i testujesz wariacje na zwycięzcy, a nie zimne domysły; możesz przeglądać żywe kreacje konkurentów za darmo przy pomocy narzędzia do badań natywnych reklam. Mniej, lepszych wariantów oznacza mniejsze próbki, krótsze testy i mniej budżetu spalonego na odkrywanie.

Przykład z życia, od początku do końca#

Załóżmy, że prowadzisz ofertę lead‑gen z wypłatą $60, z jedną kampanią generującą około 1 500 kliknięć dziennie w Twoich komórkach testowych.

  • Etap kreatywny: cztery kreacje rywalizują na poziomie CTR. Kilka tysięcy wyświetleń każda rozwiązuje się w 2–3 dni; odrzuć do dwóch najlepszych.
  • Etap landingu: dwa landingi na poziomie konwersji. Podstawowy CVR około 3%, wykrycie 30% względnego wzrostu (0,9 punktu bezwzględnego): n ≈ 16 × 0,03 × 0,97 ÷ 0,009² ≈ 5 700 kliknięć na wariant, czyli około 11 400 łącznie. Przy 1 500 kliknięć dziennie to osiem dni — można to nazwać pełnym tygodniem plus weekend.
  • Werdykt: jeden cykl testowy trwa 10–12 dni od startu do obronnego zwycięzcy, przy czym wydatki na przegrane są ograniczone przez regułę guardrail, a nie pozostawione w nadziei.

To realistyczny kształt „jak długo”: kilka dni taniego triage, tydzień‑plus skoncentrowanego pomiaru i długość kalendarzowa determinowana przez Twój wolumen kliknięć — nie przez magiczną liczbę dni.

Najczęściej zadawane pytania

Ile konwersji potrzebuję na wariant w teście A/B reklamy?
Jako zasada praktyczna, 50–100 konwersji na wariant wykrywa duże różnice (30%+ względnie) z rozsądną pewnością, podczas gdy małe podwyżki 10–15% mogą wymagać tysięcy. Wzór n ≈ 16 × p(1−p) ÷ d² podaje dokładną liczbę dla Twojej bazowej stawki i różnicy, którą chcesz wykryć. Jeśli Twój wolumen nie osiągnie tego w ciągu około czterech tygodni, przetestuj większy obrót kreatywny zamiast tego.
Czy 3 dni to wystarczająco długo, aby przeprowadzić test A/B reklamy?
Nie. Nawet gdy kampania o wysokim wolumenie zbiera dużą próbkę w trzy dni, masz jedynie część tygodniowego cyklu — odbiorcy w dni robocze i weekendy konwertują inaczej, a opóźnienie konwersji oznacza, że wczesne kliknięcia nie zakończyły jeszcze konwersji. Przeprowadzaj test przynajmniej przez pełne siedem dni. Wyjątek stanowi wczesne odrzucanie na podstawie CTR, kiedy triageujesz oczywiste przegrane zamiast deklarować statystycznie ważnego zwycięzcę.
Czy powinienem testować reklamy pod kątem CTR czy współczynnika konwersji?
Oba, na różnych etapach. Testy na poziomie CTR wymagają jedynie wyświetleń, które są tanie i szybkie, więc używaj ich do wczesnego odrzucania słabych kreacji. Testy współczynnika konwersji mierzą to, za co faktycznie płacisz, ale wymagają 10–100× większego budżetu, więc rezerwuj je dla finalistów oraz zmian w landing page lub lejku. Testowanie wszystkiego na poziomie konwersji to sposób, w jaki małe konta spalają budżet na rygor, na który nie stać.
Co się stanie, jeśli zatrzymam test A/B, gdy tylko osiągnie istotność?
Znacząco podniesiesz współczynnik fałszywych trafień. Sprawdzanie codziennie i zatrzymanie przy pierwszym istotnym wyniku oznacza, że wiele „zwycięzców” to szum, który z większą ilością danych by się odwrócił — klasyczny problem podglądu. Zobowiąż się do określonej wielkości próby, używaj codziennych kontroli jedynie w sytuacjach stop‑loss, takich jak zepsuty tracking lub niekontrolowane wydatki, i oceniaj wyniki dopiero po zakończeniu zbierania próby.
Dlaczego mój zwycięski wariant reklamy przestał wygrywać po zakończeniu testu?
Zwykle regresja do średniej: wczesna przewaga wariantu zawierała element szczęścia, a jego długoterminowa wydajność zbliża się do średniej. Zmęczenie kreatywne potęguje to — świeży zwycięzca traci na skuteczności, gdy odbiorcy widzą go wielokrotnie. To powody, by okresowo ponownie testować zwycięzców i traktować każdy pojedynczy wynik jako szacunek z przedziałem błędu, a nie jako trwałą prawdę.
Zespół OpenAdLibrary
AutorZespół OpenAdLibrary
Analiza reklam i badania reklam natywnych

Tworzymy OpenAdLibrary, otwartą platformę transparentności reklam. Każdego dnia nasze systemy przechwytują na żywo reklamy natywne w sieciach Taboola, Outbrain, MGID, Revcontent, Teads, Yahoo i MSN, identyfikują prawdziwego reklamodawcę za każdą z nich i śledzą kliknięcie do strony docelowej. Te przewodniki destylują to, co widzimy w tych danych, abyś mógł szybciej badać rynek.