Hvor lenge bør man kjøre A/B-tester for annonser: Praktisk anvendelse av utvalgsstørrelsesberegninger
Varighet på A/B-tester er regnestykker, ikke folketro: nødvendig utvalg delt på daglig volum. Her er utvalgsstørrelsesregningen gjort praktisk, pluss bunnlinjen, taket og stoppreglene som holder testing overkommelig.

Kjør en A/B-test for annonser til hver variant har samlet nok konverteringer til å gjøre forskjellen du bryr deg om synlig — ikke i et fast antall dager. Som en praktisk tommelfingerregel betyr det minst én hel uke for å dekke ukedags-sykluser, og mellom 50 og noen tusen konverteringer per variant avhengig av hvor liten en forskjell du vil oppdage. Varighet er et resultat av regnestykker, ikke en kalenderpreferanse: dager nødvendig = nødvendig utvalg per variant ÷ ditt daglige volum per variant. Denne artikkelen gir deg den regningen, bunnlinjen og taket som overstyrer den, og den billigere testsekvensen å bruke når regnestykket sier du ikke har råd til signifikans.
Varighet er et resultat, ikke et kalendervalg#
De fleste råd gir deg et fast svar — syv dager, fjorten dager, en måned. Dager er feil enhet. En kampanje som genererer 40 konverteringer om dagen løser en landingsside-test på omtrent en uke; den samme testen på en kampanje som genererer 4 om dagen tar over to måneder, og da er resultatet forurenset av alt som har endret seg i mellomtiden. Tre inngangsdata bestemmer din faktiske varighet:
- Baseraten for målet du tester — CTR for kreativer, konverteringsrate for landingssider og tilbud.
- Den minste forskjellen verdt å oppdage. Å oppdage en 10 % heving koster langt mer trafikk enn å oppdage en 50 % heving, og de fleste små hevinger er ikke verdt utgiftene det tar å se dem.
- Daglig volum per variant — satt av budsjettet og budene dine.
Sett de to første faste og det nødvendige utvalget kommer ut av en formel. Del på det tredje og du har din varighet. Hvis svaret blir lengre enn omtrent fire uker, er det vanligvis rett trekk å endre testen, ikke å kjøre den ut — mer om det nedenfor.
Utvalgsstørrelsesregningen, uten statistikkeksamenen#
Standardsnarveien for en to-variant test med 95 % konfidens og 80 % styrke:
n per variant ≈ 16 × p × (1 − p) ÷ d²
hvor p er din baserate som desimal og d er den absolutte forskjellen du ønsker å oppdage. To utregnede eksempler:
- Kreativtest på CTR-nivå. Basis CTR 0,5 %, oppdager en 20 % relativ heving (0,1 poeng absolutte): n ≈ 16 × 0,005 × 0,995 ÷ 0,001² ≈ 80 000 impresjoner per variant. Native-plasseringer serverer impresjoner raskt og billig, så dette kan løses på dager.
- Landingsside-test på konverteringsnivå. Basis konverteringsrate 2 %, oppdager en 25 % relativ heving (0,5 poeng absolutte): n ≈ 16 × 0,02 × 0,98 ÷ 0,005² ≈ 12 500 klikk per variant. Til en $0,40 CPC er dette en fem-sifret test for et enkelt par sider.
| Hva du tester | Baserate | Heving å oppdage | Utvalg per variant |
|---|---|---|---|
| CTR (kreativ) | 0,5% | 20% relativt | ~80 000 impresjoner |
| CTR (kreativ) | 0,5% | 50% relativt | ~13 000 impresjoner |
| CVR (landingsside) | 2% | 25% relativt | ~12 500 klikk |
| CVR (landingsside) | 2% | 50% relativt | ~3 100 klikk |
| CVR (tilbudsside) | 5% | 25% relativt | ~4 900 klikk |
To lærdommer kommer ut av tabellen. For det første er små hevinger brutalt dyre: å halvere den oppdagelige forskjellen firedobler utvalget. For det andre koster testing på impresjonsnivå en brøkdel av testing på klikknivå. Den asymmetrien bør forme hele testprogrammet ditt: test kreative vinkler på CTR-nivå, test konverteringskanaler på konverteringsnivå, og ikke test knappfarge-størrelsesendringer i det hele tatt — utvalget som trengs for å oppdage dem lønner seg sjelden.
Bunnlinjen: én hel uke, uansett hva regnestykket sier#
Selv når volumet leverer utvalget ditt på to dager, kjør minst sju. Hverdag og helgepublikum oppfører seg forskjellig — forskjellige folk, forskjellige enheter, forskjellig intensjon. Utgiver-miksen på native-nettverk roterer gjennom uken ettersom nyhetssykluser og innholdsplaner skifter, så tirsdagens trafikk er ikke lørdagens trafikk. Konverteringsforsinkelse legger til en annen skjevhet: en variants torsdagsklikk kan konvertere på lørdag, så en tidlig avslutning systematisk favoriserer hvilken variant som tilfeldigvis fikk sine impresjoner først. En test som slutter midt i uken har tatt utvalg av en skjev skive av din virkelige trafikk, og «vinneren» kan bare være hverdagens spesialist.
Taket: lange tester råtner fra innsiden#
Etter tre til fire uker slutter en A/B-test å være et kontrollert eksperiment. Kreativ tretthet forfaller begge variantene — sjelden med samme hastighet, som stille vender rangeringer midt i testen. Konkurrenter kommer inn og forlater auksjonen og endrer trafikkkvaliteten din. Sesongvariasjon flyter under hele sammenligningen. Hvis formelen sier du trenger seks uker med trafikk, les det som en dom: forskjellen du jakter på er for liten til å oppdage med ditt volum. Test et større sving i stedet — en annen hook eller vinkel, en annen kanalstruktur — hvor den oppdagelige forskjellen er stor og utvalget er overkommelig.
Ikke kikk — eller i det minste ikke handle på kikk#
Den klassiske feilmodusen: sjekk dashbordet daglig og erklær seier den første dagen tallene ser signifikante ut. Gjentatte blikk på akkumulerende data blåser opp falske positiver dramatisk — med daglig «peeking» vil en «den traff signifikans på et tidspunkt» stoppregel utløses langt oftere enn den annonserte 5 % feilraten. Regresjon mot gjennomsnittet forklarer da de fleste «min vinner sluttet å vinne» klager: varianten som hoppet frempå dag to rykte på støy, og den drifter tilbake. Disiplinen er enkel: forplikte deg på forhånd til utvalgsstørrelsen, overvåk daglig kun for stopptap-betingelser — ødelagt sporingsdata, løpsk utgifter, en variant som presterer katastrofalt — og evaluer vinneren én gang, på slutten.
Stoppregler for når du ikke har råd til signifikans#
De fleste native- og affiliate-kjøpere kan ikke finansiere 12 500 klikk per variant, og å late som om de kan det, gir falsk strenghet. Den ærlige alternativen er trinnvis sortering — grovere enn signifikanstesting, og standardpraksis blant kjøpere som tester dusinvis av kreativer i måneden:
- CTR-sortering (dag 1–3). Gi hver kreativ noen tusen impresjoner, så drep alt som tydelig er under resten. Du beviser ingenting — du sorterer slik at budsjettet konsentreres på plausible vinnere.
- Utgiftsbuffer (rullende). En vanlig praksisregel: stopp enhver variant som har brukt 2–3× ditt mål-CPA med null konverteringer. Det er ikke statistikk; det er overlevelse.
- Signifikans på finalistene. Når to eller tre overlevere bærer mesteparten av utgiftene, kjør en ordentlig test på konverteringsnivå mellom dem ved å bruke regnestykket ovenfor. Du finansierer én ekte test i stedet for ti falske.
Snarvei rundt utvalget: start fra annonser som allerede har overlevd#
Hver variant du ikke trenger å teste er penger spart, og den billigste informasjonen om hva som fungerer er hva konkurrentene fortsetter å betale for å kjøre. En annonse som har kjørt i 30+ dager har bestått eierens lønnsomhetssjekk hver eneste dag av den kjøringen. OpenAdLibrarys indeks med 725 000+ levende native-kreativer på tvers av 49 nettverk (juni 2026) registrerer første-sett og sist-sett datoer for hver kreativ, som gjør annonselevetid til et filterbart signal snarere enn en anelse — de lengstkjørende native annonsene i din bransje er et forhåndstestet startgitter. Bygg testen din rundt to eller tre vinkler allerede bevist i markedet og du tester variasjoner av en vinner i stedet for kalde gjetninger; du kan bla gjennom levende konkurrentkreativer gratis med verktøyet for native annonseforskning. Færre, bedre varianter betyr mindre utvalg, kortere tester og mindre budsjett brent på oppdagelse.
Et utregnet eksempel fra ende til annen#
La oss si du kjører et lead-gen tilbud med $60 utbetaling, med én kampanje som gjør omtrent 1 500 klikk om dagen på tvers av testcellene dine.
- Kreativstadium: fire kreativer konkurrerer på CTR-nivå. Noen tusen impresjoner hver løser seg på 2–3 dager; sorter ut de to beste.
- Landingssidestadium: to landingssider på konverteringsnivå. Basis CVR rundt 3 %, oppdager en 30 % relativ heving (0,9 poeng absolutte): n ≈ 16 × 0,03 × 0,97 ÷ 0,009² ≈ 5 700 klikk per variant, omtrent 11 400 totalt. Med 1 500 klikk om dagen er det åtte dager — kall det en hel uke pluss helgedekning.
- Resultat: én testsyklus tar 10–12 dager fra lansering til en forsvarlig vinner, med tapende utgifter begrenset av bufferregelen i stedet for å la dem kjøre på håp.
Det er den realistiske formen på «hvor lenge»: noen dager med billig sortering, en uke-pluss med fokusert måling, og en kalenderlengde diktert av klikkvolumet ditt — ikke av noens magiske antall dager.







