OpenAdLibraryOpenAdLibrary
廣告創意與轉換漏斗

廣告 A/B 測試該跑多久?讓樣本數計算變得實用

A/B 測試時長是算術問題,而非經驗法則:所需樣本數除以每日流量。這裡提供實用的樣本數計算方法,以及確保測試成本可控的底線、上限與終止規則。

編輯插圖:廣告 A/B 測試該跑多久?讓樣本數計算變得實用

廣告 A/B 測試應持續進行,直到每個變體收集到足夠的轉換數,使你在意的差異變得可見——而非固定天數。作為一個實用原則,這意味著至少一個完整週以涵蓋週期變化,並且每個變體需要 50 到數千次轉換,具體取決於你想檢測的差異有多小。時長是算術的結果,而非日曆偏好:所需天數 = 每個變體所需樣本數 ÷ 你每個變體的每日流量。本文將提供這個算術、覆蓋它的底線與上限,以及當數學告訴你負擔不起顯著性測試時,可以使用的更便宜測試流程。

時長是結果,而非日曆選擇#

多數建議給你一個固定答案——七天、十四天、一個月。天數是錯誤的單位。一個每天產生 40 次轉換的廣告活動,大約一週就能完成登陸頁測試;同樣的測試放在每天只產生 4 次轉換的廣告活動上,則需要兩個多月,屆時結果已被期間的一切變化所污染。三個輸入決定了你的實際時長:

  • 你測試指標的基準率——創意測試用 CTR,登陸頁和產品測試用轉換率
  • 值得檢測的最小差異。檢測 10% 的提升所需的流量遠多於檢測 50% 的提升,而大多數小幅提升不值得為檢測它們所花費的支出。
  • 每個變體的每日流量——由你的預算和出價決定。

固定前兩項,所需樣本數就會從公式中得出。除以第三項,你就得到了時長。如果答案超過大約四周,通常正確的做法是改變測試內容,而非硬撐下去——下文將詳細說明。

樣本數計算,無需統計學位#

在 95% 信心水準和 80% 檢定力下,雙變體測試的標準簡化公式:

每個變體 n ≈ 16 × p × (1 − p) ÷ d²

其中 p 是你的基準率(小數形式),d 是你要檢測的絕對差異。兩個計算範例:

  • CTR 層級的創意測試。基準 CTR 0.5%,檢測 20% 的相對提升(絕對值 0.1 個百分點):n ≈ 16 × 0.005 × 0.995 ÷ 0.001² ≈ 每個變體 80,000 次曝光。原生廣告版位能快速且便宜地提供曝光,因此幾天內就能完成。
  • 轉換層級的登陸頁測試。基準轉換率 2%,檢測 25% 的相對提升(絕對值 0.5 個百分點):n ≈ 16 × 0.02 × 0.98 ÷ 0.005² ≈ 每個變體 12,500 次點擊。以每次點擊成本 $0.40 計算,這是一個針對單一頁面對的五位數測試。
測試項目 基準率 欲檢測的提升幅度 每個變體所需樣本
CTR (創意) 0.5% 相對 20% ~80,000 次曝光
CTR (創意) 0.5% 相對 50% ~13,000 次曝光
CVR (登陸頁) 2% 相對 25% ~12,500 次點擊
CVR (登陸頁) 2% 相對 50% ~3,100 次點擊
CVR (產品頁) 5% 相對 25% ~4,900 次點擊

從這個表格可以得出兩個教訓。首先,檢測小幅提升的成本極高:將可檢測的差異減半,樣本數會變成四倍。其次,在曝光層級進行測試的成本僅為點擊層級測試的一小部分。這種不對稱性應該塑造你的整個測試計畫:在 CTR 層級測試創意角度,在轉換層級測試漏斗,並且根本不要測試像按鈕顏色這種微小的變更——檢測它們所需的樣本數很少能回本。

底線:無論計算結果如何,至少跑滿一週#

即使流量能在兩天內達到你的樣本數要求,也至少要跑滿七天。平日與週末的受眾行為不同——不同的人、不同的裝置、不同的意圖。原生廣告網路上的發布商組合會隨著新聞週期和內容排程在一週內輪換,因此週二的流量不等於週六的流量。轉換延遲會帶來第二種偏差:某個變體週四的點擊可能在週六才轉換,因此過早結束測試會系統性地偏向於哪個變體恰好先獲得曝光。在週中結束的測試只採樣了你真實流量的一個偏斜片段,而「贏家」可能只是平日的專家。

上限:長期測試會從內部腐壞#

超過三到四周,A/B 測試就不再是一個受控實驗。創意疲勞會使兩個變體衰退——衰退速度很少相同,這會悄悄地在測試中期逆轉排名。競爭對手進出競價會改變你的流量品質。季節性因素在整個比較過程中逐漸漂移。如果公式告訴你需要六週的流量,請將其視為一個判決:你試圖尋找的差異太小,以你目前的流量無法檢測出來。改為測試更大的差異——不同的鉤子或角度、不同的漏斗結構——其中可檢測的差異較大,且樣本數是可負擔的。

不要窺探——或者至少不要根據窺探結果採取行動#

經典的失敗模式:每天檢查儀表板,並在數字第一次看起來顯著時就宣告勝利。重複查看累積數據會戲劇性地增加誤報率——在每日窺探的情況下,「某個時間點達到顯著性」的停止規則觸發的頻率遠高於宣稱的 5% 錯誤率。均值回歸隨後解釋了大多數「我的贏家不再贏了」的抱怨:第二天領先的變體只是搭上了雜訊的順風車,隨後便會回歸。紀律很簡單:預先承諾樣本數,每日監控僅用於止損條件——追蹤失效、支出失控、某個變體表現災難性差——並在結束時一次性評估贏家。

當你負擔不起顯著性測試時的終止規則#

大多數原生廣告和聯盟行銷買家無法為每個變體提供 12,500 次點擊的資金,假裝可以只會產生虛假的嚴謹度。誠實的替代方案是分階段淘汰——比顯著性測試更粗糙,但卻是每月測試數十個創意的買家們的標準做法:

  1. CTR 淘汰(第 1–3 天)。給每個創意幾千次曝光,然後淘汰所有明顯落後於群體的。你並非在證明什麼——你是在進行分類,以便預算集中在有潛力的贏家上。
  2. 支出防護欄(滾動式)。一個常見的實務規則:暫停任何支出已達目標 CPA 2–3 倍卻零轉換的變體。這不是統計學;這是生存法則。
  3. 對最終候選者進行顯著性測試。一旦兩三個倖存者承擔了大部分支出,使用上述數學方法在它們之間進行一次適當的轉換層級測試。你資助的是一個真實的測試,而非十個虛假的測試。

縮短路徑:從已經存活的廣告開始#

每一個你不需要測試的變體都是省下的錢,而關於什麼有效的最便宜資訊,就是競爭對手持續付費投放的內容。一個已經投放 30 天以上的廣告,在投放期間的每一天都通過了其擁有者的獲利能力檢查。OpenAdLibrary 對 49 個網路(2026 年 6 月)超過 725,000 個活躍原生廣告創意的索引,記錄了每個創意的首次出現和最後出現日期,這將廣告壽命轉變為可篩選的信號,而非猜測——你所在垂直領域中運行時間最長的原生廣告就是一個經過預先測試的起跑線。圍繞兩三個已在市場上驗證有效的角度來構建你的測試,你就是在測試贏家的變體,而非憑空猜測;你可以使用原生廣告研究工具免費瀏覽競爭對手的活躍創意。更少、更好的變體意味著更小的樣本、更短的測試,以及更少的預算浪費在探索上。

一個從頭到尾的完整範例#

假設你運行一個支付 $60 的潛在客戶開發產品,有一個廣告活動每天在你的測試單元中產生大約 1,500 次點擊。

  • 創意階段:四個創意在 CTR 層級競爭。每個創意幾千次曝光,2–3 天內就能決定;淘汰到前兩名。
  • 登陸頁階段:兩個登陸頁在轉換層級測試。基準 CVR 約 3%,檢測 30% 的相對提升(絕對值 0.9 個百分點):n ≈ 16 × 0.03 × 0.97 ÷ 0.009² ≈ 每個變體 5,700 次點擊,總計約 11,400 次。以每天 1,500 次點擊計算,大約是八天——算上涵蓋週末,大約一週多一點。
  • 結論:一個測試週期從啟動到得出有說服力的贏家,大約需要 10–12 天,失敗者的支出受到防護欄規則的限制,而非任由其在希望中持續消耗。

這就是「該跑多久」的現實樣貌:幾天便宜的初步篩選,一週多的集中測量,而日曆長度由你的點擊流量決定——而非任何人的神奇天數。

常見問題

廣告 A/B 測試中,每個變體需要多少轉換數?
一個實用的原則是,每個變體 50–100 次轉換可以以合理的信心度檢測出較大的差異(相對 30% 以上),而要檢測出 10–15% 的小幅提升則可能需要數千次轉換。公式 n ≈ 16 × p(1−p) ÷ d² 能根據你的基準轉換率和你想檢測的差異幅度,給出精確的數字。如果你的流量無法在大約四周內達到這個數字,那就改為測試創意上更大的差異。
跑 3 天的廣告 A/B 測試足夠嗎?
不夠。即使高流量的廣告活動能在三天內收集到大量樣本,你也只採樣了部分週期——平日與週末的受眾轉換行為不同,且轉換延遲意味著早期的點擊尚未完成轉換。至少跑滿七個完整日。例外情況是早期的 CTR 篩選,此時你是在淘汰明顯的輸家,而非宣告一個統計上有效的贏家。
我應該根據 CTR 還是轉換率來測試廣告?
兩者都要,但在不同階段進行。CTR 層級的測試只需要曝光次數,這既便宜又快速,因此可早期用來淘汰表現不佳的創意。轉換率測試衡量的是你實際獲利的指標,但需要 10–100 倍的預算,因此應保留給最終候選者以及登陸頁或漏斗的變更。對所有項目都進行轉換率層級的測試,是小型帳戶如何將預算燒在負擔不起的嚴謹度上的原因。
如果我在 A/B 測試一達到顯著性就停止,會發生什麼事?
你會戲劇性地提高誤報率。每天檢查並在第一次出現顯著讀數時就停止,意味著許多「贏家」只是雜訊,隨著數據增加會回歸均值——這是典型的窺探問題。預先承諾樣本數,每日檢查僅用於止損條件(如追蹤失效或支出失控),並在樣本收集完成時一次性評估結果。
為什麼我的獲勝廣告變體在測試結束後就不再領先了?
通常是均值回歸:該變體早期的領先優勢包含運氣成分,其長期表現更接近平均值。創意疲勞加劇了這種情況——新鮮的贏家會隨著受眾反覆看到而衰退。這兩點都是需要定期重新測試優勝者,並將任何單次測試結果視為帶有誤差範圍的估計值,而非永久事實的原因。
OpenAdLibrary 團隊
作者OpenAdLibrary 團隊
廣告情報與原生廣告研究

我們打造了 OpenAdLibrary,這個公開的廣告透明度平台。每天,我們的系統都會捕捉 Taboola、Outbrain、MGID、Revcontent、Teads、Yahoo 和 MSN 上的原生廣告,識別每個廣告背後真正的廣告主,並追蹤點擊至其登陸頁面。這些指南精煉了我們從數據中觀察到的內容,讓您能更快地研究市場動態。