OpenAdLibraryOpenAdLibrary
Annonskreativitet & Funnels

Hur länge du ska köra annons‑A/B‑tester: Praktisk beräkning av provstorlek

A/B‑testlängd är aritmetik, inte folklore: nödvändig provstorlek delat med daglig volym. Här är provstorleksberäkningen i praktisk form, samt golv, tak och avbrytningsregler som håller testerna prisvärda.

Redaktionell illustration: Hur länge du ska köra annons‑A/B‑tester: Praktisk beräkning av provstorlek

Kör ett annons‑A/B‑test tills varje variant har samlat in tillräckligt med konverteringar för att den skillnad du bryr dig om blir synlig — inte för ett fast antal dagar. Som en tumregel betyder det åtminstone en hel vecka för att täcka veckodagscykler, och någonstans mellan 50 och några tusen konverteringar per variant beroende på hur liten skillnad du vill upptäcka. Varaktigheten är ett resultat av aritmetik, inte en kalenderpreferens: dagar behövs = nödvändig provstorlek per variant ÷ din dagliga volym per variant. Denna artikel ger dig den aritmetiken, golv och tak som åsidosätter den, samt den billigare testsekvensen att använda när matematiken säger att du inte har råd med signifikans.

Varaktigheten är ett resultat, inte ett kalenderval#

De flesta råd ger dig ett fast svar — sju dagar, fjorton dagar, en månad. Dagar är fel enhet. En kampanj som genererar 40 konverteringar per dag löser ett landningssidetest på ungefär en vecka; samma test på en kampanj som genererar 4 per dag tar över två månader, och då är resultatet förorenat av allt som förändrats under tiden. Tre faktorer bestämmer din faktiska varaktighet:

  • Grundnivån för den metrik du testar — CTR för kreativa, conversion rate för landningssidor och erbjudanden.
  • Den minsta skillnaden som är värd att upptäcka. Att upptäcka ett 10 %‑lyft kostar mycket mer trafik än att upptäcka ett 50 %‑lyft, och de flesta små lyft är inte värda den spend som krävs för att se dem.
  • Daglig volym per variant — bestäms av din budget och dina bud.

Fixa de två första så faller den nödvändiga provstorleken ur en formel. Dividera med den tredje så får du din varaktighet. Om svaret blir längre än ungefär fyra veckor är det vanligen rätt att ändra testet, inte att köra det längre — mer om det nedan.

Provstorleksberäkningen, utan statistikkunskap#

Den standardiserade genvägen för ett två‑variantstest med 95 %‑konfidens och 80 %‑styrka:

n per variant ≈ 16 × p × (1 − p) ÷ d²

där p är din grundnivå som decimal och d är den absoluta skillnad du vill upptäcka. Två genomarbetade exempel:

  • Kreativt test på CTR‑nivå. Grund‑CTR 0,5 %, upptäcker ett 20 % relativt lyft (0,1 % absoluta punkter): n ≈ 16 × 0,005 × 0,995 ÷ 0,001² ≈ 80 000 impressioner per variant. Native‑placeringar levererar impressioner snabbt och billigt, så detta kan lösas på dagar.
  • Lander‑test på konverteringsnivå. Grund‑konverteringsgrad 2 %, upptäcker ett 25 % relativt lyft (0,5 % absoluta punkter): n ≈ 16 × 0,02 × 0,98 ÷ 0,005² ≈ 12 500 klick per variant. Vid $0.40 CPC är det ett femsiffrigt test för ett enda par sidor.
Vad du testar Grundnivå Lyft att upptäcka Prov per variant
CTR (kreativ) 0,5 % 20 % relativ ~80 000 impressioner
CTR (kreativ) 0,5 % 50 % relativ ~13 000 impressioner
CVR (lander) 2 % 25 % relativ ~12 500 klick
CVR (lander) 2 % 50 % relativ ~3 100 klick
CVR (erbjudandesida) 5 % 25 % relativ ~4 900 klick

Två lärdomar framträder ur tabellen. Först är små lyft brutalt dyra: att halvera den detekterbara skillnaden fyrdubblar provet. För det andra kostar testning på impression‑nivå en liten bråkdel av testning på klick‑nivå. Den asymmetrin bör forma hela ditt testprogram: testa kreativa vinklar på CTR‑nivå, testa funnels på konverteringsnivå, och testa inte knapp‑färg‑ändringar alls — provet som krävs för att upptäcka dem betalar sällan för sig självt.

Golvet: en hel vecka, oavsett vad matematiken säger#

Även när volymen levererar ditt prov på två dagar, kör åtminstone sju. Vardag‑ och helgpublik beter sig olika — olika personer, olika enheter, olika avsikt. Publikmixen på native‑nätverk roterar genom veckan när nyhetscykler och innehållsscheman skiftar, så tisdags‑trafik är inte lördagstrafik. Konverteringsfördröjning lägger till en andra bias: en variants torsdag‑klick kan konvertera på lördag, så ett tidigt snitt gynnar systematiskt den variant som fick sina impressioner först. Ett test som avslutas mitt i veckan har samplat en skev del av din faktiska trafik, och "vinnaren" kan helt enkelt vara veckodagsspecialisten.

Taket: långa tester ruttnar inifrån#

Efter tre till fyra veckor slutar ett A/B‑test vara ett kontrollerat experiment. Creative fatigue avtar båda varianterna — sällan i samma takt, vilket tyst vänder rankingar mitt i testet. Konkurrenter går in och ut ur auktionen och förändrar din trafik­kvalitet. Säsongsvariationer glider under hela jämförelsen. Om formeln säger att du behöver sex veckors trafik, läs det som ett verdict: skillnaden du jagar är för liten för att upptäckas med din volym. Testa en större svängning istället — en annan hook or angle, en annan funnel‑struktur — där den detekterbara skillnaden är stor och provet är prisvärt.

Titta inte — eller åtminstone agera inte på tittar‑ögonblick#

Det klassiska fel‑modelet: kolla dashboarden dagligen och deklarera seger den första dagen siffrorna ser signifikanta ut. Upprepade blickar på ackumulerande data ökar falska positiva dramatiskt — med daglig peek‑ning avfyras en "det nådde signifikans någon gång"‑stop‑regel mycket oftare än den annonserade 5 % fel‑frekvensen. Regression till medelvärdet förklarar sedan de flesta "min vinnare slutade vinna"‑klagomål: varianten som hoppade fram på dag två redde på brus, och den drar tillbaka. Disciplinen är enkel: förhandsbestäm ditt prov, övervaka dagligen endast för stop‑loss‑förhållanden — trasig spårning, okontrollerad spend, en variant som presterar katastrofalt — och utvärdera vinnaren en gång, i slutet.

Avbrytningsregler för när du inte har råd med signifikans#

De flesta native‑ och affiliate‑köpare kan inte finansiera 12 500 klick per variant, och att låtsas annars skapar falsk rigor. Det ärliga alternativet är stegvis cull — grövre än signifikans‑testning, och standardpraxis bland köpare som testar dussintals kreativa per månad:

  1. CTR‑cull (dag 1–3). Ge varje kreativ några tusen impressioner, döp sedan allt som tydligt ligger under paketet. Du bevisar inget — du triagerar så att budgeten koncentreras på plausibla vinnare.
  2. Spend‑guardrail (rullande). En vanlig praktikerregel: pausa vilken variant som helst som har spenderat 2–3 × ditt mål‑CPA utan konverteringar. Det är inte statistik; det är överlevnad.
  3. Signifikans på finalisterna. När två eller tre överlevare bär majoriteten av spenden, kör ett riktigt konverterings‑nivå‑test mellan dem med formeln ovan. Du finansierar ett riktigt test istället för tio falska.

Snabba provet: börja med annonser som redan överlevt#

Varje variant du inte behöver testa är pengar sparade, och den billigaste informationen om vad som fungerar är vad konkurrenterna fortsätter betala för att köra. En annons som har körts i 30 + dagar har klarat sin ägares lönsamhetskontroll varje dag av den körningen. OpenAdLibrarys index med 725 000 + live‑native‑kreativa över 49 nätverk (juni 2026) registrerar första‑ och sista‑seendatum för varje kreativ, vilket förvandlar ad longevity till en filtrerbar signal snarare än en gissning — de longest‑running native ads i din vertikal är ett förtestat startgaller. Bygg ditt test kring två eller tre angles already proven in the wild så testar du variationer på en vinnare istället för kalla gissningar; du kan bläddra bland live‑konkurrentkreativa gratis med native ad research tool. Färre, bättre varianter betyder mindre prov, kortare tester och mindre budget bränd på upptäckt.

Ett genomarbetat exempel, från början till slut#

Anta att du kör ett $60‑utbetalnings‑lead‑gen‑erbjudande med en kampanj som levererar ungefär 1 500 klick per dag över dina testceller.

  • Kreativ fas: fyra kreativa tävlar på CTR‑nivå. Några tusen impressioner vardera löser på 2–3 dagar; culla till de två bästa.
  • Lander‑fas: två landningssidor på konverteringsnivå. Grund‑CVR runt 3 %, upptäcker ett 30 % relativt lyft (0,9 % absoluta punkter): n ≈ 16 × 0,03 × 0,97 ÷ 0,009² ≈ 5 700 klick per variant, cirka 11 400 totalt. Vid 1 500 klick per dag blir det åtta dagar — kalla det en hel vecka plus helg.
  • Verdict: en testcykel kör 10–12 dagar från start till en försvarbar vinnare, med förlorad spend begränsad av guardrail‑regeln snarare än att låta den fortsätta på hopp.

Det är den realistiska formen av "hur länge": några dagar billig triage, en vecka‑plus fokuserad mätning, och en kalenderlängd dikterad av din klick‑volym — inte av någon magisk dagssiffra.

Vanliga frågor

Hur många konverteringar behöver jag per variant i ett annons‑A/B‑test?
Som en tumregel upptäcker 50–100 konverteringar per variant stora skillnader (30 %+ relativ) med rimlig säkerhet, medan små 10–15 %‑lyft kan kräva tusentals. Formeln n ≈ 16 × p(1−p) ÷ d² ger det exakta antalet för din grundläggande nivå och den skillnad du vill upptäcka. Om din volym inte kan nå det inom ungefär fyra veckor, testa en större kreativ svängning istället.
Är 3 dagar tillräckligt länge för att köra ett annons‑A/B‑test?
Nej. Även när en högvolymkampanj samlar ett stort prov på tre dagar har du bara fångat en del av veckocyklusen – vardags‑ och helgpublik konverterar olika, och konverteringsfördröjning betyder att tidiga klick ännu inte har konverterat. Kör minst sju hela dagar. Undantaget är tidig CTR‑cull, där du triagerar uppenbara förlorare snarare än att deklarera en statistiskt giltig vinnare.
Bör jag testa annonser på CTR eller konverteringsgrad?
Båda, men i olika faser. CTR‑tester kräver bara impressioner, som är billiga och snabba, så använd dem för att rensa svaga kreativa tidigt. Konverteringsgradstester mäter det du faktiskt betalar för men kräver 10–100 × mer budget, så reservera dem för finalister och för landningssida‑ eller funnel‑ändringar. Att testa allt på konverteringsnivå är hur små konton bränner budget på rigor som de inte har råd med.
Vad händer om jag stoppar ett A/B‑test så snart det blir signifikant?
Du ökar din falska‑positiva‑frekvens dramatiskt. Att kontrollera dagligen och stoppa vid den första signifikanta avläsningen betyder att många "vinnare" är brus som skulle ha återgått med mer data – det klassiska peek‑problemet. Förhandsbestäm en provstorlek, använd dagliga kontroller endast för stop‑loss‑förhållanden som trasig spårning eller okontrollerad spend, och utvärdera en gång när provet är komplett.
Varför slutade min vinnande annonsvariant vinna efter testet?
Vanligtvis regression till medelvärdet: variantens tidiga ledning innehöll tur, och dess långsiktiga prestanda ligger närmare genomsnittet. Kreativ trötthet förvärrar detta – en färsk vinnare avtar när publiken ser den upprepade gånger. Båda är skäl att periodiskt åter‑testa vinnare och att behandla varje enskilt testresultat som en uppskattning med felintervall, inte ett permanent faktum.
OpenAdLibrary-teamet
Skriven avOpenAdLibrary-teamet
Annonsintelligens & forskning om native advertising

Vi bygger OpenAdLibrary, den öppna plattformen för annonstransparens. Varje dag fångar våra system levande native-annonser på Taboola, Outbrain, MGID, Revcontent, Teads, Yahoo och MSN, identifierar den verkliga annonsören bakom varje annons och följer klicket till dess landningssida. Dessa guider destillerar vad vi ser i den datan så att du snabbare kan forska på marknaden.