Jak długo prowadzić testy A/B reklam: Praktyczne obliczenia wielkości próby
Czas trwania testu A/B to arytmetyka, nie folklor: wymagana próba podzielona przez dzienny wolumen. Oto praktyczne obliczenia wielkości próby, plus limity dolne, górne i zasady zakończenia, które utrzymują testy w przystępnych kosztach.

Przeprowadzaj test A/B reklamy, dopóki każdy wariant nie zgromadzi wystarczającej liczby konwersji, aby różnica, na której Ci zależy, stała się widoczna — nie przez określoną liczbę dni. Jako zasada praktyczna oznacza to co najmniej pełny tydzień, aby objąć cykle dni tygodnia, oraz od 50 do kilku tysięcy konwersji na wariant, w zależności od tego, jak małą różnicę chcesz wykryć. Czas trwania jest wynikiem arytmetyki, nie preferencją kalendarzową: dni potrzebne = wymagana próba na wariant ÷ Twój dzienny wolumen na wariant. Ten artykuł podaje tę arytmetykę, limity dolne i górne, które ją nadpisują, oraz tańszą sekwencję testowania, gdy matematyka wskazuje, że nie stać Cię na istotność.
Czas trwania jest wynikiem, nie wyborem kalendarzowym#
Większość porad daje stałą odpowiedź — siedem dni, czternaście dni, miesiąc. Dni są niewłaściwą jednostką. Kampania generująca 40 konwersji dziennie rozwiązuje test landing page w około tydzień; ten sam test przy kampanii generującej 4 dziennie zajmuje ponad dwa miesiące, a w tym czasie wynik zostaje skażony wszystkim, co się zmieniło. Trzy czynniki decydują o rzeczywistym czasie trwania:
- Podstawowa stopa mierzonej metryki — CTR dla kreacji, współczynnik konwersji dla landingów i ofert.
- Najmniejsza różnica warta wykrycia. Wykrycie 10% podwyżki kosztuje znacznie więcej ruchu niż wykrycie 50% podwyżki, a większość małych podwyżek nie jest warta wydatków potrzebnych do ich zobaczenia.
- Dzienny wolumen na wariant — określony przez budżet i stawki.
Ustal pierwsze dwa, a wymagana próba wypływa z wzoru. Podziel przez trzeci i otrzymasz czas trwania. Jeśli wynik jest dłuższy niż około cztery tygodnie, prawidłowym ruchem jest zwykle zmiana testu, a nie przedłużanie go — więcej o tym poniżej.
Matematyka wielkości próby, bez stopnia statystyki#
Standardowy skrót dla testu dwuwariantowego przy 95% pewności i 80% mocy:
n na wariant ≈ 16 × p × (1 − p) ÷ d²
gdzie p to Twoja podstawowa stopa wyrażona jako ułamek, a d to bezwzględna różnica, którą chcesz wykryć. Dwa przykłady:
- Test kreacji na poziomie CTR. Podstawowy CTR 0,5%, wykrycie 20% względnego wzrostu (0,1 punktu bezwzględnego): n ≈ 16 × 0,005 × 0,995 ÷ 0,001² ≈ 80 000 wyświetleń na wariant. Natywne miejsca publikacji dostarczają wyświetleń szybko i tanio, więc można to rozwiązać w ciągu kilku dni.
- Test landingu na poziomie konwersji. Podstawowy współczynnik konwersji 2%, wykrycie 25% względnego wzrostu (0,5 punktu bezwzględnego): n ≈ 16 × 0,02 × 0,98 ÷ 0,005² ≈ 12 500 kliknięć na wariant. Przy CPC $0.40 to test pięciocyfrowy dla jednej pary stron.
| Co testujesz | Podstawa | Wykrywany lift | Próbka na wariant |
|---|---|---|---|
| CTR (kreacja) | 0.5% | 20% względnie | ~80,000 wyświetleń |
| CTR (kreacja) | 0.5% | 50% względnie | ~13,000 wyświetleń |
| CVR (landing) | 2% | 25% względnie | ~12,500 kliknięć |
| CVR (landing) | 2% | 50% względnie | ~3,100 kliknięć |
| CVR (strona oferty) | 5% | 25% względnie | ~4,900 kliknięć |
Dwie lekcje wypływają z tej tabeli. Po pierwsze, małe podwyżki są brutalnie kosztowne: zmniejszenie wykrywalnej różnicy o połowę czterokrotnie zwiększa wymaganą próbę. Po drugie, testowanie na poziomie wyświetleń kosztuje niewielką część tego, co testowanie na poziomie kliknięć. Ta asymetria powinna kształtować cały Twój program testowy: testuj kąty kreatywne na poziomie CTR, testuj lejki na poziomie konwersji i nie testuj zmian rozmiaru przycisku — próbka potrzebna do ich wykrycia rzadko się zwraca.
Limit dolny: pełny tydzień, niezależnie od wyniku matematyki#
Nawet gdy wolumen dostarczy Twoją próbkę w dwa dni, przeprowadzaj test przynajmniej przez siedem dni. Odbiorcy w dni robocze i weekendy zachowują się inaczej — różni ludzie, różne urządzenia, różna intencja. Mieszanka wydawców w sieciach natywnych rotuje w ciągu tygodnia wraz z cyklami wiadomości i harmonogramami treści, więc ruch we wtorek nie jest tym samym, co w sobotę. Opóźnienie konwersji dodaje drugi bias: kliknięcia wariantu w czwartek mogą konwertować w sobotę, więc wczesne odcięcie systematycznie faworyzuje wariant, który otrzymał wyświetlenia jako pierwszy. Test kończący się w połowie tygodnia próbuje skośną część rzeczywistego ruchu, a „zwycięzca” może po prostu być specjalistą od dni roboczych.
Limit górny: długie testy psują się od środka#
Po trzech‑czterech tygodniach test A/B przestaje być kontrolowanym eksperymentem. Zmęczenie kreatywne osłabia oba warianty — rzadko w tym samym tempie, co cicho odwraca rankingi w trakcie testu. Konkurenci wchodzą i wychodzą z aukcji, zmieniając jakość Twojego ruchu. Sezonowość dryfuje pod całą porównawczą ramą. Jeśli wzór wskazuje, że potrzebujesz sześciu tygodni ruchu, odczytaj to jako werdykt: różnica, której szukasz, jest zbyt mała, by ją wykryć przy Twoim wolumenie. Zamiast tego przetestuj większy obrót — inny hook lub angle, inną strukturę lejka — gdzie wykrywalna różnica jest duża, a próbka przystępna.
Nie podglądaj — albo przynajmniej nie reaguj na podglądy#
Klasyczny tryb awaryjny: codziennie sprawdzasz dashboard i ogłaszasz zwycięstwo w pierwszym dniu, gdy liczby wyglądają na istotne. Wielokrotne spojrzenia na rosnące dane dramatycznie zwiększają fałszywe trafienia — przy codziennym podglądzie reguła „osiągnęło istotność w pewnym momencie” uruchamia się znacznie częściej niż reklamowany 5% poziom błędu. Regresja do średniej wyjaśnia potem większość skarg „mój zwycięzca przestał wygrywać”: wariant, który wyprzedził w drugim dniu, jechał na szumie i wraca do normy. Dyscyplina jest prosta: zobowiąż się do wielkości próby, monitoruj codziennie wyłącznie w sytuacjach stop‑loss — zepsuty tracking, niekontrolowane wydatki, wariant katastrofalnie słaby — i oceniaj zwycięzcę raz, na koniec.
Zasady zakończenia, gdy nie stać Cię na istotność#
Większość nabywców natywnych i afiliacyjnych nie może sfinansować 12 500 kliknięć na wariant, a udawanie, że tak, generuje fałszywą rygorystyczność. Uczciwą alternatywą jest etapowe odrzucanie — mniej precyzyjne niż testowanie istotności, a standardowa praktyka wśród nabywców testujących dziesiątki kreacji miesięcznie:
- Odcięcie CTR (dni 1–3). Daj każdej kreacji kilka tysięcy wyświetleń, potem usuń wszystko wyraźnie poniżej średniej. Nie dowodzisz niczego — triageujesz, aby budżet skoncentrował się na prawdopodobnych zwycięzcach.
- Guardrail wydatków (rolling). Powszechna reguła praktyków: wstrzymaj każdy wariant, który wydał 2–3× Twój docelowy CPA przy zerowych konwersjach. To nie statystyka; to przetrwanie.
- Istotność na finalistach. Gdy dwaj lub trzej ocalałe warianty pochłaniają większość wydatków, przeprowadź właściwy test na poziomie konwersji między nimi, używając powyższej matematyki. Sfinansujesz jeden prawdziwy test zamiast dziesięciu fałszywych.
Skróć próbkę: zacznij od reklam, które już przetrwały#
Każdy wariant, którego nie musisz testować, to zaoszczędzone pieniądze, a najtańszą informacją o tym, co działa, jest to, co konkurenci nadal płacą, aby uruchomić. Reklama, która działała ponad 30 dni, przeszła codziennie kontrolę rentowności właściciela. Indeks OpenAdLibrary obejmujący ponad 725 000 aktywnych natywnych kreacji w 49 sieciach (czerwiec 2026) rejestruje daty pierwszego i ostatniego widzenia każdej kreacji, co zamienia długowieczność reklamy w filtrujący sygnał, a nie w przeczucie — najdłużej działające natywne reklamy w Twojej branży to wstępnie przetestowana siatka startowa. Buduj test wokół dwóch lub trzech kątów już udowodnionych w praktyce i testujesz wariacje na zwycięzcy, a nie zimne domysły; możesz przeglądać żywe kreacje konkurentów za darmo przy pomocy narzędzia do badań natywnych reklam. Mniej, lepszych wariantów oznacza mniejsze próbki, krótsze testy i mniej budżetu spalonego na odkrywanie.
Przykład z życia, od początku do końca#
Załóżmy, że prowadzisz ofertę lead‑gen z wypłatą $60, z jedną kampanią generującą około 1 500 kliknięć dziennie w Twoich komórkach testowych.
- Etap kreatywny: cztery kreacje rywalizują na poziomie CTR. Kilka tysięcy wyświetleń każda rozwiązuje się w 2–3 dni; odrzuć do dwóch najlepszych.
- Etap landingu: dwa landingi na poziomie konwersji. Podstawowy CVR około 3%, wykrycie 30% względnego wzrostu (0,9 punktu bezwzględnego): n ≈ 16 × 0,03 × 0,97 ÷ 0,009² ≈ 5 700 kliknięć na wariant, czyli około 11 400 łącznie. Przy 1 500 kliknięć dziennie to osiem dni — można to nazwać pełnym tygodniem plus weekend.
- Werdykt: jeden cykl testowy trwa 10–12 dni od startu do obronnego zwycięzcy, przy czym wydatki na przegrane są ograniczone przez regułę guardrail, a nie pozostawione w nadziei.
To realistyczny kształt „jak długo”: kilka dni taniego triage, tydzień‑plus skoncentrowanego pomiaru i długość kalendarzowa determinowana przez Twój wolumen kliknięć — nie przez magiczną liczbę dni.







