Hur länge du ska köra annons‑A/B‑tester: Praktisk beräkning av provstorlek
A/B‑testlängd är aritmetik, inte folklore: nödvändig provstorlek delat med daglig volym. Här är provstorleksberäkningen i praktisk form, samt golv, tak och avbrytningsregler som håller testerna prisvärda.

Kör ett annons‑A/B‑test tills varje variant har samlat in tillräckligt med konverteringar för att den skillnad du bryr dig om blir synlig — inte för ett fast antal dagar. Som en tumregel betyder det åtminstone en hel vecka för att täcka veckodagscykler, och någonstans mellan 50 och några tusen konverteringar per variant beroende på hur liten skillnad du vill upptäcka. Varaktigheten är ett resultat av aritmetik, inte en kalenderpreferens: dagar behövs = nödvändig provstorlek per variant ÷ din dagliga volym per variant. Denna artikel ger dig den aritmetiken, golv och tak som åsidosätter den, samt den billigare testsekvensen att använda när matematiken säger att du inte har råd med signifikans.
Varaktigheten är ett resultat, inte ett kalenderval#
De flesta råd ger dig ett fast svar — sju dagar, fjorton dagar, en månad. Dagar är fel enhet. En kampanj som genererar 40 konverteringar per dag löser ett landningssidetest på ungefär en vecka; samma test på en kampanj som genererar 4 per dag tar över två månader, och då är resultatet förorenat av allt som förändrats under tiden. Tre faktorer bestämmer din faktiska varaktighet:
- Grundnivån för den metrik du testar — CTR för kreativa, conversion rate för landningssidor och erbjudanden.
- Den minsta skillnaden som är värd att upptäcka. Att upptäcka ett 10 %‑lyft kostar mycket mer trafik än att upptäcka ett 50 %‑lyft, och de flesta små lyft är inte värda den spend som krävs för att se dem.
- Daglig volym per variant — bestäms av din budget och dina bud.
Fixa de två första så faller den nödvändiga provstorleken ur en formel. Dividera med den tredje så får du din varaktighet. Om svaret blir längre än ungefär fyra veckor är det vanligen rätt att ändra testet, inte att köra det längre — mer om det nedan.
Provstorleksberäkningen, utan statistikkunskap#
Den standardiserade genvägen för ett två‑variantstest med 95 %‑konfidens och 80 %‑styrka:
n per variant ≈ 16 × p × (1 − p) ÷ d²
där p är din grundnivå som decimal och d är den absoluta skillnad du vill upptäcka. Två genomarbetade exempel:
- Kreativt test på CTR‑nivå. Grund‑CTR 0,5 %, upptäcker ett 20 % relativt lyft (0,1 % absoluta punkter): n ≈ 16 × 0,005 × 0,995 ÷ 0,001² ≈ 80 000 impressioner per variant. Native‑placeringar levererar impressioner snabbt och billigt, så detta kan lösas på dagar.
- Lander‑test på konverteringsnivå. Grund‑konverteringsgrad 2 %, upptäcker ett 25 % relativt lyft (0,5 % absoluta punkter): n ≈ 16 × 0,02 × 0,98 ÷ 0,005² ≈ 12 500 klick per variant. Vid $0.40 CPC är det ett femsiffrigt test för ett enda par sidor.
| Vad du testar | Grundnivå | Lyft att upptäcka | Prov per variant |
|---|---|---|---|
| CTR (kreativ) | 0,5 % | 20 % relativ | ~80 000 impressioner |
| CTR (kreativ) | 0,5 % | 50 % relativ | ~13 000 impressioner |
| CVR (lander) | 2 % | 25 % relativ | ~12 500 klick |
| CVR (lander) | 2 % | 50 % relativ | ~3 100 klick |
| CVR (erbjudandesida) | 5 % | 25 % relativ | ~4 900 klick |
Två lärdomar framträder ur tabellen. Först är små lyft brutalt dyra: att halvera den detekterbara skillnaden fyrdubblar provet. För det andra kostar testning på impression‑nivå en liten bråkdel av testning på klick‑nivå. Den asymmetrin bör forma hela ditt testprogram: testa kreativa vinklar på CTR‑nivå, testa funnels på konverteringsnivå, och testa inte knapp‑färg‑ändringar alls — provet som krävs för att upptäcka dem betalar sällan för sig självt.
Golvet: en hel vecka, oavsett vad matematiken säger#
Även när volymen levererar ditt prov på två dagar, kör åtminstone sju. Vardag‑ och helgpublik beter sig olika — olika personer, olika enheter, olika avsikt. Publikmixen på native‑nätverk roterar genom veckan när nyhetscykler och innehållsscheman skiftar, så tisdags‑trafik är inte lördagstrafik. Konverteringsfördröjning lägger till en andra bias: en variants torsdag‑klick kan konvertera på lördag, så ett tidigt snitt gynnar systematiskt den variant som fick sina impressioner först. Ett test som avslutas mitt i veckan har samplat en skev del av din faktiska trafik, och "vinnaren" kan helt enkelt vara veckodagsspecialisten.
Taket: långa tester ruttnar inifrån#
Efter tre till fyra veckor slutar ett A/B‑test vara ett kontrollerat experiment. Creative fatigue avtar båda varianterna — sällan i samma takt, vilket tyst vänder rankingar mitt i testet. Konkurrenter går in och ut ur auktionen och förändrar din trafikkvalitet. Säsongsvariationer glider under hela jämförelsen. Om formeln säger att du behöver sex veckors trafik, läs det som ett verdict: skillnaden du jagar är för liten för att upptäckas med din volym. Testa en större svängning istället — en annan hook or angle, en annan funnel‑struktur — där den detekterbara skillnaden är stor och provet är prisvärt.
Titta inte — eller åtminstone agera inte på tittar‑ögonblick#
Det klassiska fel‑modelet: kolla dashboarden dagligen och deklarera seger den första dagen siffrorna ser signifikanta ut. Upprepade blickar på ackumulerande data ökar falska positiva dramatiskt — med daglig peek‑ning avfyras en "det nådde signifikans någon gång"‑stop‑regel mycket oftare än den annonserade 5 % fel‑frekvensen. Regression till medelvärdet förklarar sedan de flesta "min vinnare slutade vinna"‑klagomål: varianten som hoppade fram på dag två redde på brus, och den drar tillbaka. Disciplinen är enkel: förhandsbestäm ditt prov, övervaka dagligen endast för stop‑loss‑förhållanden — trasig spårning, okontrollerad spend, en variant som presterar katastrofalt — och utvärdera vinnaren en gång, i slutet.
Avbrytningsregler för när du inte har råd med signifikans#
De flesta native‑ och affiliate‑köpare kan inte finansiera 12 500 klick per variant, och att låtsas annars skapar falsk rigor. Det ärliga alternativet är stegvis cull — grövre än signifikans‑testning, och standardpraxis bland köpare som testar dussintals kreativa per månad:
- CTR‑cull (dag 1–3). Ge varje kreativ några tusen impressioner, döp sedan allt som tydligt ligger under paketet. Du bevisar inget — du triagerar så att budgeten koncentreras på plausibla vinnare.
- Spend‑guardrail (rullande). En vanlig praktikerregel: pausa vilken variant som helst som har spenderat 2–3 × ditt mål‑CPA utan konverteringar. Det är inte statistik; det är överlevnad.
- Signifikans på finalisterna. När två eller tre överlevare bär majoriteten av spenden, kör ett riktigt konverterings‑nivå‑test mellan dem med formeln ovan. Du finansierar ett riktigt test istället för tio falska.
Snabba provet: börja med annonser som redan överlevt#
Varje variant du inte behöver testa är pengar sparade, och den billigaste informationen om vad som fungerar är vad konkurrenterna fortsätter betala för att köra. En annons som har körts i 30 + dagar har klarat sin ägares lönsamhetskontroll varje dag av den körningen. OpenAdLibrarys index med 725 000 + live‑native‑kreativa över 49 nätverk (juni 2026) registrerar första‑ och sista‑seendatum för varje kreativ, vilket förvandlar ad longevity till en filtrerbar signal snarare än en gissning — de longest‑running native ads i din vertikal är ett förtestat startgaller. Bygg ditt test kring två eller tre angles already proven in the wild så testar du variationer på en vinnare istället för kalla gissningar; du kan bläddra bland live‑konkurrentkreativa gratis med native ad research tool. Färre, bättre varianter betyder mindre prov, kortare tester och mindre budget bränd på upptäckt.
Ett genomarbetat exempel, från början till slut#
Anta att du kör ett $60‑utbetalnings‑lead‑gen‑erbjudande med en kampanj som levererar ungefär 1 500 klick per dag över dina testceller.
- Kreativ fas: fyra kreativa tävlar på CTR‑nivå. Några tusen impressioner vardera löser på 2–3 dagar; culla till de två bästa.
- Lander‑fas: två landningssidor på konverteringsnivå. Grund‑CVR runt 3 %, upptäcker ett 30 % relativt lyft (0,9 % absoluta punkter): n ≈ 16 × 0,03 × 0,97 ÷ 0,009² ≈ 5 700 klick per variant, cirka 11 400 totalt. Vid 1 500 klick per dag blir det åtta dagar — kalla det en hel vecka plus helg.
- Verdict: en testcykel kör 10–12 dagar från start till en försvarbar vinnare, med förlorad spend begränsad av guardrail‑regeln snarare än att låta den fortsätta på hopp.
Det är den realistiska formen av "hur länge": några dagar billig triage, en vecka‑plus fokuserad mätning, och en kalenderlängd dikterad av din klick‑volym — inte av någon magisk dagssiffra.







