OpenAdLibraryOpenAdLibrary
Ad Creative & Funnels

Hvor lenge bør man kjøre A/B-tester for annonser: Praktisk anvendelse av utvalgsstørrelsesberegninger

Varighet på A/B-tester er regnestykker, ikke folketro: nødvendig utvalg delt på daglig volum. Her er utvalgsstørrelsesregningen gjort praktisk, pluss bunnlinjen, taket og stoppreglene som holder testing overkommelig.

Redaksjonell illustrasjon: Hvor lenge bør man kjøre A/B-tester for annonser: Praktisk anvendelse av utvalgsstørrelsesberegninger

Kjør en A/B-test for annonser til hver variant har samlet nok konverteringer til å gjøre forskjellen du bryr deg om synlig — ikke i et fast antall dager. Som en praktisk tommelfingerregel betyr det minst én hel uke for å dekke ukedags-sykluser, og mellom 50 og noen tusen konverteringer per variant avhengig av hvor liten en forskjell du vil oppdage. Varighet er et resultat av regnestykker, ikke en kalenderpreferanse: dager nødvendig = nødvendig utvalg per variant ÷ ditt daglige volum per variant. Denne artikkelen gir deg den regningen, bunnlinjen og taket som overstyrer den, og den billigere testsekvensen å bruke når regnestykket sier du ikke har råd til signifikans.

Varighet er et resultat, ikke et kalendervalg#

De fleste råd gir deg et fast svar — syv dager, fjorten dager, en måned. Dager er feil enhet. En kampanje som genererer 40 konverteringer om dagen løser en landingsside-test på omtrent en uke; den samme testen på en kampanje som genererer 4 om dagen tar over to måneder, og da er resultatet forurenset av alt som har endret seg i mellomtiden. Tre inngangsdata bestemmer din faktiske varighet:

  • Baseraten for målet du tester — CTR for kreativer, konverteringsrate for landingssider og tilbud.
  • Den minste forskjellen verdt å oppdage. Å oppdage en 10 % heving koster langt mer trafikk enn å oppdage en 50 % heving, og de fleste små hevinger er ikke verdt utgiftene det tar å se dem.
  • Daglig volum per variant — satt av budsjettet og budene dine.

Sett de to første faste og det nødvendige utvalget kommer ut av en formel. Del på det tredje og du har din varighet. Hvis svaret blir lengre enn omtrent fire uker, er det vanligvis rett trekk å endre testen, ikke å kjøre den ut — mer om det nedenfor.

Utvalgsstørrelsesregningen, uten statistikkeksamenen#

Standardsnarveien for en to-variant test med 95 % konfidens og 80 % styrke:

n per variant ≈ 16 × p × (1 − p) ÷ d²

hvor p er din baserate som desimal og d er den absolutte forskjellen du ønsker å oppdage. To utregnede eksempler:

  • Kreativtest på CTR-nivå. Basis CTR 0,5 %, oppdager en 20 % relativ heving (0,1 poeng absolutte): n ≈ 16 × 0,005 × 0,995 ÷ 0,001² ≈ 80 000 impresjoner per variant. Native-plasseringer serverer impresjoner raskt og billig, så dette kan løses på dager.
  • Landingsside-test på konverteringsnivå. Basis konverteringsrate 2 %, oppdager en 25 % relativ heving (0,5 poeng absolutte): n ≈ 16 × 0,02 × 0,98 ÷ 0,005² ≈ 12 500 klikk per variant. Til en $0,40 CPC er dette en fem-sifret test for et enkelt par sider.
Hva du tester Baserate Heving å oppdage Utvalg per variant
CTR (kreativ) 0,5% 20% relativt ~80 000 impresjoner
CTR (kreativ) 0,5% 50% relativt ~13 000 impresjoner
CVR (landingsside) 2% 25% relativt ~12 500 klikk
CVR (landingsside) 2% 50% relativt ~3 100 klikk
CVR (tilbudsside) 5% 25% relativt ~4 900 klikk

To lærdommer kommer ut av tabellen. For det første er små hevinger brutalt dyre: å halvere den oppdagelige forskjellen firedobler utvalget. For det andre koster testing på impresjonsnivå en brøkdel av testing på klikknivå. Den asymmetrien bør forme hele testprogrammet ditt: test kreative vinkler på CTR-nivå, test konverteringskanaler på konverteringsnivå, og ikke test knappfarge-størrelsesendringer i det hele tatt — utvalget som trengs for å oppdage dem lønner seg sjelden.

Bunnlinjen: én hel uke, uansett hva regnestykket sier#

Selv når volumet leverer utvalget ditt på to dager, kjør minst sju. Hverdag og helgepublikum oppfører seg forskjellig — forskjellige folk, forskjellige enheter, forskjellig intensjon. Utgiver-miksen på native-nettverk roterer gjennom uken ettersom nyhetssykluser og innholdsplaner skifter, så tirsdagens trafikk er ikke lørdagens trafikk. Konverteringsforsinkelse legger til en annen skjevhet: en variants torsdagsklikk kan konvertere på lørdag, så en tidlig avslutning systematisk favoriserer hvilken variant som tilfeldigvis fikk sine impresjoner først. En test som slutter midt i uken har tatt utvalg av en skjev skive av din virkelige trafikk, og «vinneren» kan bare være hverdagens spesialist.

Taket: lange tester råtner fra innsiden#

Etter tre til fire uker slutter en A/B-test å være et kontrollert eksperiment. Kreativ tretthet forfaller begge variantene — sjelden med samme hastighet, som stille vender rangeringer midt i testen. Konkurrenter kommer inn og forlater auksjonen og endrer trafikkkvaliteten din. Sesongvariasjon flyter under hele sammenligningen. Hvis formelen sier du trenger seks uker med trafikk, les det som en dom: forskjellen du jakter på er for liten til å oppdage med ditt volum. Test et større sving i stedet — en annen hook eller vinkel, en annen kanalstruktur — hvor den oppdagelige forskjellen er stor og utvalget er overkommelig.

Ikke kikk — eller i det minste ikke handle på kikk#

Den klassiske feilmodusen: sjekk dashbordet daglig og erklær seier den første dagen tallene ser signifikante ut. Gjentatte blikk på akkumulerende data blåser opp falske positiver dramatisk — med daglig «peeking» vil en «den traff signifikans på et tidspunkt» stoppregel utløses langt oftere enn den annonserte 5 % feilraten. Regresjon mot gjennomsnittet forklarer da de fleste «min vinner sluttet å vinne» klager: varianten som hoppet frempå dag to rykte på støy, og den drifter tilbake. Disiplinen er enkel: forplikte deg på forhånd til utvalgsstørrelsen, overvåk daglig kun for stopptap-betingelser — ødelagt sporingsdata, løpsk utgifter, en variant som presterer katastrofalt — og evaluer vinneren én gang, på slutten.

Stoppregler for når du ikke har råd til signifikans#

De fleste native- og affiliate-kjøpere kan ikke finansiere 12 500 klikk per variant, og å late som om de kan det, gir falsk strenghet. Den ærlige alternativen er trinnvis sortering — grovere enn signifikanstesting, og standardpraksis blant kjøpere som tester dusinvis av kreativer i måneden:

  1. CTR-sortering (dag 1–3). Gi hver kreativ noen tusen impresjoner, så drep alt som tydelig er under resten. Du beviser ingenting — du sorterer slik at budsjettet konsentreres på plausible vinnere.
  2. Utgiftsbuffer (rullende). En vanlig praksisregel: stopp enhver variant som har brukt 2–3× ditt mål-CPA med null konverteringer. Det er ikke statistikk; det er overlevelse.
  3. Signifikans på finalistene. Når to eller tre overlevere bærer mesteparten av utgiftene, kjør en ordentlig test på konverteringsnivå mellom dem ved å bruke regnestykket ovenfor. Du finansierer én ekte test i stedet for ti falske.

Snarvei rundt utvalget: start fra annonser som allerede har overlevd#

Hver variant du ikke trenger å teste er penger spart, og den billigste informasjonen om hva som fungerer er hva konkurrentene fortsetter å betale for å kjøre. En annonse som har kjørt i 30+ dager har bestått eierens lønnsomhetssjekk hver eneste dag av den kjøringen. OpenAdLibrarys indeks med 725 000+ levende native-kreativer på tvers av 49 nettverk (juni 2026) registrerer første-sett og sist-sett datoer for hver kreativ, som gjør annonselevetid til et filterbart signal snarere enn en anelse — de lengstkjørende native annonsene i din bransje er et forhåndstestet startgitter. Bygg testen din rundt to eller tre vinkler allerede bevist i markedet og du tester variasjoner av en vinner i stedet for kalde gjetninger; du kan bla gjennom levende konkurrentkreativer gratis med verktøyet for native annonseforskning. Færre, bedre varianter betyr mindre utvalg, kortere tester og mindre budsjett brent på oppdagelse.

Et utregnet eksempel fra ende til annen#

La oss si du kjører et lead-gen tilbud med $60 utbetaling, med én kampanje som gjør omtrent 1 500 klikk om dagen på tvers av testcellene dine.

  • Kreativstadium: fire kreativer konkurrerer på CTR-nivå. Noen tusen impresjoner hver løser seg på 2–3 dager; sorter ut de to beste.
  • Landingssidestadium: to landingssider på konverteringsnivå. Basis CVR rundt 3 %, oppdager en 30 % relativ heving (0,9 poeng absolutte): n ≈ 16 × 0,03 × 0,97 ÷ 0,009² ≈ 5 700 klikk per variant, omtrent 11 400 totalt. Med 1 500 klikk om dagen er det åtte dager — kall det en hel uke pluss helgedekning.
  • Resultat: én testsyklus tar 10–12 dager fra lansering til en forsvarlig vinner, med tapende utgifter begrenset av bufferregelen i stedet for å la dem kjøre på håp.

Det er den realistiske formen på «hvor lenge»: noen dager med billig sortering, en uke-pluss med fokusert måling, og en kalenderlengde diktert av klikkvolumet ditt — ikke av noens magiske antall dager.

Ofte stilte spørsmål

Hvor mange konverteringer trenger jeg per variant i en A/B-test for annonser?
Som en praktisk tommelfingerregel, 50–100 konverteringer per variant oppdager store forskjeller (30 %+ relativt) med rimelig sikkerhet, mens små hevinger på 10–15 % kan kreve tusenvis. Formelen n ≈ 16 × p(1−p) ÷ d² gir det nøyaktige tallet for din baserate og den forskjellen du ønsker å oppdage. Hvis ditt volum ikke kan nå det innen omtrent fire uker, test et større kreativt sving i stedet.
Er 3 dager lenge nok til å kjøre en A/B-test for annonser?
Nei. Selv når en høyt volum-kampanje samler et stort utvalg på tre dager, har du kun tatt utvalg fra deler av ukes-rytmen — hverdags- og helgepublikum konverterer forskjellig, og konverteringsforsinkelse betyr at tidlige klikk ikke er ferdig konvertert. Kjør minst sju hele dager. Unntaket er tidlig CTR-sortering, der du sorterer ut åpenbare tapere snarere enn å erklære en statistisk gyldig vinner.
Burde jeg teste annonser på CTR eller konverteringsrate?
Begge deler, på ulike stadier. CTR-nivå-tester trenger kun impresjoner, som er billige og raske, så bruk dem til å sortere ut svake kreativer tidlig. Konverteringsrate-tester måler det du faktisk får betalt for, men trenger 10–100× mer budsjett, så forbehold dem for finalister og for landingssider eller kanalendringer. Å teste alt på konverteringsnivå er hvordan små kontoer brenner budsjett på strenghet de ikke har råd til.
Hva skjer hvis jeg stopper en A/B-test så snart den når signifikans?
Du blåser opp falskpositiv-raten din dramatisk. Å sjekke daglig og stoppe ved den første signifikante avlesningen betyr at mange 'vinnere' er støy som ville ha regressert med mer data — det klassiske «peeking»-problemet. Forplikte deg på forhånd til en utvalgsstørrelse, bruk daglige sjekker kun for stoppbetingelser som ødelagt sporingsdata eller løpsk utgifter, og evaluer én gang når utvalget er fullført.
Hvorfor sluttet vinner-annonsevarianten min å vinne etter testen?
Vanligvis regresjon mot gjennomsnittet: variantens tidlige ledelse inneholdt lykketreff, og dens langsiktige ytelse ligger nærmere gjennomsnittet. Kreativ tretthet forsterker dette — en ny vinner avtar etter hvert som publikum ser den gjentatte ganger. Begge er grunner til å teste vinnere på nytt med jevne mellomrom, og til å behandle ethvert enkelt testresultat som et estimat med feilmarginer, ikke en permanent fakta.
OpenAdLibrary-teamet
Skrevet avOpenAdLibrary-teamet
Ad-intelligens og forskning på native annonsering

Vi bygger OpenAdLibrary, den åpne annonsetransparensplattformen. Hver dag fanger systemene våre live native annonser på tvers av Taboola, Outbrain, MGID, Revcontent, Teads, Yahoo og MSN, identifiserer den faktiske annonsøren bak hver enkelt, og følger klikket til landingssiden. Disse veiledningene destillerer det vi ser i disse dataene slik at du kan undersøke markedet raskere.