OpenAdLibraryOpenAdLibrary
Ad Creative & Funnels

Hvor længe skal man køre A/B-tests af annoncer: Stikprøvestørrelsesmatematik gjort praktisk

Varigheden af en A/B-test er aritmetik, ikke folketro: påkrævet stikprøve divideret med daglig volumen. Her er stikprøvestørrelsesmatematikken gjort brugbar, plus de gulve, lofter og stopregler, der holder tests overkommelige.

Redaktionel illustration: Hvor længe skal man køre A/B-tests af annoncer: Stikprøvestørrelsesmatematik gjort praktisk

Kør en A/B-test af en annonce, indtil hver variant har indsamlet nok konverteringer til at gøre den forskel, du bekymrer dig om, synlig — ikke i et fast antal dage. Som en praktisk tommelfingerregel betyder det mindst en hel uge for at dække dag-i-ugen-cyklusser, og et sted mellem 50 og et par tusinde konverteringer pr. variant afhængigt af, hvor lille en forskel du vil opdage. Varighed er et output af aritmetik, ikke en kalenderpræference: nødvendige dage = påkrævet stikprøve pr. variant ÷ din daglige volumen pr. variant. Denne artikel giver dig den aritmetik, de gulve og lofter, der tilsidesætter den, og den billigere testsekvens, du skal bruge, når matematikken siger, du ikke har råd til signifikans.

Varighed er et output, ikke et kalendervalg#

De fleste råd giver dig et fast svar — syv dage, fjorten dage, en måned. Dage er den forkerte enhed. En kampagne, der genererer 40 konverteringer om dagen, afgør en landingssidetest på omkring en uge; den samme test på en kampagne, der genererer 4 om dagen, tager over to måneder, hvorefter resultatet er forurenet af alt, der ændrede sig i mellemtiden. Tre input afgør din rigtige varighed:

  • Basisraten for den metrik, du tester — CTR for kreativer, konverteringsrate for landingssider og tilbud.
  • Den mindste forskel, der er værd at opdage. At opdage en 10% forbedring koster langt mere trafik end at opdage en 50% forbedring, og de fleste små forbedringer er ikke værd det forbrug, det koster at se dem.
  • Daglig volumen pr. variant — bestemt af dit budget og dine bud.

Fastlæg de to første, og den påkrævede stikprøve følger af en formel. Divider med den tredje, og du har din varighed. Hvis svaret kommer ud længere end cirka fire uger, er det rigtige træk normalt at ændre testen, ikke at køre den ud — mere om det nedenfor.

Stikprøvestørrelsesmatematikken, minus statistikuddannelsen#

Den standard genvej for en to-variant-test ved 95% konfidens og 80% styrke:

n pr. variant ≈ 16 × p × (1 − p) ÷ d²

hvor p er din basisrate som decimal og d er den absolutte forskel, du vil opdage. To gennemregnede eksempler:

  • Kreativ test på CTR-niveau. Basis CTR 0,5%, opdager en 20% relativ forbedring (0,1 point absolut): n ≈ 16 × 0,005 × 0,995 ÷ 0,001² ≈ 80.000 visninger pr. variant. Native-placeringer leverer visninger hurtigt og billigt, så dette kan afgøres på dage.
  • Landingssidetest på konverteringsniveau. Basis konverteringsrate 2%, opdager en 25% relativ forbedring (0,5 point absolut): n ≈ 16 × 0,02 × 0,98 ÷ 0,005² ≈ 12.500 klik pr. variant. Ved et $0,40 CPC er det en femcifret test for et enkelt par sider.
Hvad du tester Basis Forbedring at opdage Stikprøve pr. variant
CTR (kreativ) 0,5% 20% relativ ~80.000 visninger
CTR (kreativ) 0,5% 50% relativ ~13.000 visninger
CVR (landingsside) 2% 25% relativ ~12.500 klik
CVR (landingsside) 2% 50% relativ ~3.100 klik
CVR (tilbudsside) 5% 25% relativ ~4.900 klik

To lærdommer følger af den tabel. For det første er små forbedringer brutalt dyre: halvering af den detekterbare forskel firedobler stikprøven. For det andet koster test på visningsniveau en lille brøkdel af test på klikniveau. Den asymmetri bør forme hele dit testprogram: test kreative vinkler på CTR-niveau, test tragt på konverteringsniveau, og test ikke knapfarvestørrelsesændringer overhovedet — den stikprøve, der skal til for at opdage dem, tjener sig sjældent hjem.

Gulvet: en hel uge, uanset hvad matematikken siger#

Selv når volumen leverer din stikprøve på to dage, så kør mindst syv. Hverdag- og weekendpublikum opfører sig forskelligt — forskellige mennesker, forskellige enheder, forskellig intention. Udgiverblandingen på native-netværk roterer gennem ugen, efterhånden som nyhedscyklusser og indholdsskemaer skifter, så tirsdagens trafik er ikke lørdagens trafik. Konverteringsforsinkelse tilføjer en anden bias: en variants torsdagsklik kan konvertere på lørdag, så et tidligt cut favoriserer systematisk den variant, der tilfældigvis fik sine visninger først. En test, der slutter midt på ugen, har prøvet en skæv skive af din rigtige trafik, og 'vinderen' kan simpelthen være hverdagens specialist.

Loftet: lange tests rådner indefra#

Efter tre til fire uger stopper en A/B-test med at være et kontrolleret eksperiment. Kreativ træthed forringer begge varianter — sjældent i samme hastighed, hvilket stille og roligt vender rangeringer undervejs i testen. Konkurrenter kommer ind i og forlader auktionen og ændrer din trafikkvalitet. Sæsonudsving bevæger sig under hele sammenligningen. Hvis formlen siger, du har brug for seks ugers trafik, så læs det som en dom: den forskel, du jager, er for lille til at opdage ved din volumen. Test i stedet et større sving — en anden hook eller vinkel, en anden tragtestruktur — hvor den detekterbare forskel er stor, og stikprøven er overkommelig.

Kig ikke — eller i det mindste: handle ikke på kig#

Den klassiske fejltilstand: tjek dashboardet dagligt og erklær sejr den første dag, tallene ser signifikante ud. Gentagne kig på akkumulerende data forøger falske positiver dramatisk — med dagligt kiggen fyrer en 'den ramte signifikans på et tidspunkt'-stopregel langt oftere end den annoncerede 5% fejlrate. Regression mod gennemsnittet forklarer så de fleste 'min vinder stoppede med at vinde'-klager: varianten, der sprang foran på dag to, red på støj, og den driver tilbage. Disciplinen er enkel: forpligt dig på forhånd til din stikprøvestørrelse, overvåg dagligt kun for stop-loss-betingelser — ødelagt tracking, løbsk forbrug, en variant, der præsterer katastrofalt — og evaluér vinderen én gang, ved slutningen.

Stopregler for når du ikke har råd til signifikans#

De fleste native- og affiliate-købere kan ikke finansiere 12.500 klik pr. variant, og at lade som om andet producerer falsk strenghed. Den ærlige alternative er trinvis sortering — grovere end signifikanstestning og standardpraksis blandt købere, der tester dusinvis af kreativer om måneden:

  1. CTR-sortering (dag 1–3). Giv hver kreativ et par tusinde visninger, og dræb derefter alt, der tydeligt er under flokken. Du beviser ikke noget — du triagerer, så budgettet koncentreres om plausible vindere.
  2. Forbrugsgrænse (løbende). En almindelig praktiserende regel: pause enhver variant, der har brugt 2–3× dit mål-CPA med nul konverteringer. Det er ikke statistik; det er overlevelse.
  3. Signifikans på finalisterne. Når to eller tre overlevere bærer det meste af forbruget, kør en rigtig konverteringsniveau-test mellem dem ved hjælp af matematikken ovenfor. Du finansierer én rigtig test i stedet for ti falske.

Genvej stikprøven: start fra annoncer, der allerede overlevede#

Hver variant, du ikke behøver at teste, er penge sparet, og den billigste information om, hvad der virker, er det, konkurrenterne bliver ved med at betale for at køre. En annonce, der har kørt i 30+ dage, har bestået ejerens rentabilitetskontrol hver dag af den kørsel. OpenAdLibrarys indeks over 725.000+ levende native-kreativer på tværs af 49 netværk (juni 2026) registrerer første-set og sidste-set datoer for hver kreativ, hvilket gør annoncelanglevethed til et filtrerbart signal i stedet for en mavefornemmelse — de længstkørende native annoncer i din branche er en forudtestet startgrid. Byg din test omkring to eller tre vinkler, der allerede er bevist i det vilde, og du tester variationer over en vinder i stedet for kolde gæt; du kan gennemse levende konkurrentkreativer gratis med værktøjet til native annonceforskning. Færre, bedre varianter betyder mindre stikprøver, kortere tests og mindre budget brændt af på opdagelse.

Et gennemregnet eksempel, ende til ende#

Lad os sige, du kører et lead-gen-tilbud med $60-udbetaling med én kampagne, der giver cirka 1.500 klik om dagen på tværs af dine testceller.

  • Kreativt stadie: fire kreativer konkurrerer på CTR-niveau. Et par tusinde visninger hver afgøres på 2–3 dage; sorter til de to bedste.
  • Landingssidestadie: to landingssider på konverteringsniveau. Basis CVR omkring 3%, opdager en 30% relativ forbedring (0,9 point absolut): n ≈ 16 × 0,03 × 0,97 ÷ 0,009² ≈ 5.700 klik pr. variant, omkring 11.400 i alt. Ved 1.500 klik om dagen er det otte dage — kald det en hel uge plus weekenddækning.
  • Resultat: én testcyklus kører 10–12 dage fra lancering til en forsvarlig vinder, med tabende forbrug begrænset af grænsereglen i stedet for ladet køre på håb.

Det er den realistiske form for 'hvor længe': et par dages billig triagering, en uge-plus fokuseret måling, og en kalenderlængde dikteret af din klikvolumen — ikke af nogens magisk antal dage.

Ofte stillede spørgsmål

Hvor mange konverteringer har jeg brug for pr. variant i en A/B-test af en annonce?
Som en praktisk tommelfingerregel: 50–100 konverteringer pr. variant opdager store forskelle (30%+ relativt) med rimelig sikkerhed, mens små 10–15% forbedringer kan kræve tusinder. Formlen n ≈ 16 × p(1−p) ÷ d² giver det præcise antal for din basisrate og den forskel, du vil opdage. Hvis din volumen ikke kan nå det inden for cirka fire uger, så test i stedet et større kreativt sving.
Er 3 dage nok til at køre en A/B-test af en annonce?
Nej. Selv når en højvolumenskampagne indsamler en stor stikprøve på tre dage, har du kun prøvet en del af den ugentlige cyklus — hverdag- og weekendpublikum konverterer forskelligt, og konverteringsforsinkelse betyder, at tidlige klik endnu ikke er færdige med at konvertere. Kør mindst syv fulde dage. Undtagelsen er tidlig CTR-sortering, hvor du triagerer åbenlyse tabere i stedet for at erklære en statistisk gyldig vinder.
Skal jeg teste annoncer på CTR eller konverteringsrate?
Begge dele, på forskellige stadier. CTR-niveau-tests har kun brug for visninger, som er billige og hurtige, så brug dem til tidligt at sortere svage kreativer fra. Konverteringsrate-tests måler det, du faktisk bliver betalt for, men kræver 10–100× større budget, så forbehold dem til finalister og til landingsside- eller tragtændringer. At teste alt på konverteringsniveau er, hvordan små konti brænder budget af på strenghed, de ikke har råd til.
Hvad sker der, hvis jeg stopper en A/B-test, så snart den når signifikans?
Du forøger din falsk-positiv-rate dramatisk. At tjekke dagligt og stoppe ved den første signifikante aflæsning betyder, at mange 'vindere' er støj, der ville have regresseret med flere data — det klassiske 'peeking'-problem. Forpligt dig på forhånd til en stikprøvestørrelse, brug daglige tjek kun til stop-loss-betingelser som ødelagt tracking eller løbsk forbrug, og evaluér én gang, når stikprøven er fuldført.
Hvorfor stoppede min vindende annoncevariant med at vinde efter testen?
Normalt regression mod gennemsnittet: variantens tidlige forspring indeholdt held, og dens langsigtede præstation ligger tættere på gennemsnittet. Kreativ træthed forværrer dette — en frisk vinder falmer, efterhånden som publikum ser den gentagne gange. Begge er årsager til at gen-teste vindere periodisk og til at behandle ethvert enkelt testresultat som et estimat med fejlmarginer, ikke en permanent kendsgerning.
OpenAdLibrary-teamet
Skrevet afOpenAdLibrary-teamet
Ad-intelligence & native annoncering research

Vi bygger OpenAdLibrary, den åbne ad-transparency-platform. Hver dag indsamler vores systemer live native annoncer på tværs af Taboola, Outbrain, MGID, Revcontent, Teads, Yahoo og MSN, identificerer den rigtige annoncør bag hver enkelt og følger klikket til dens landingsside. Disse guides destillerer, hvad vi ser i disse data, så du kan undersøge markedet hurtigere.