OpenAdLibraryOpenAdLibrary
广告创意与转化漏斗

广告A/B测试应运行多久:样本量数学实用指南

A/B测试时长是算术问题,而非经验法则:所需样本除以每日流量。以下是可用的样本量数学,以及保持测试经济性的下限、上限和终止规则。

编辑插图:广告A/B测试应运行多久:样本量数学实用指南

运行广告A/B测试,直到每个变体收集到足够的转化次数,使您关心的差异变得可见——而不是固定天数。作为经验法则,这意味着至少一整周以覆盖工作日周期,以及50到几千次转化(每个变体),具体取决于您想检测的差异大小。时长是算术的输出结果,而非日历偏好:所需天数 = 每个变体所需样本 ÷ 每个变体每日流量。本文为您提供该算术、覆盖它的下限和上限,以及在数学表明您无法负担显著性时使用的更便宜的测试序列。

时长是输出结果,而非日历选择#

大多数建议给出固定答案——七天、十四天、一个月。天数是不对的单位。每天产生40次转化的活动大约一周内解决着陆页测试;同样的测试放在每天产生4次转化的活动上,需要两个多月,到那时结果已被期间发生的一切变化污染。三个输入决定您的实际时长:

  • 您测试指标的基准率——创意使用CTR,着陆页和优惠使用转化率
  • 值得检测的最小差异。 检测10%的提升所需流量远多于检测50%的提升,而且大多数小提升不值得花费流量去发现。
  • 每个变体的每日流量——由您的预算和出价决定。

确定前两个,所需样本通过公式得出。除以第三个,得到您的时长。如果答案超过大约四周,通常正确的做法是改变测试,而不是硬撑——下文详述。

样本量数学,无需统计学学位#

95%置信度和80%统计功效下双变体测试的标准简化公式:

每个变体n ≈ 16 × p × (1 − p) ÷ d²

其中p是您的小数形式基准率,d是您想检测的绝对差异。两个工作示例:

  • CTR级别的创意测试。 基准CTR 0.5%,检测20%相对提升(0.1个百分点绝对):n ≈ 16 × 0.005 × 0.995 ÷ 0.001² ≈ 每个变体80,000次展示。原生广告位快速且廉价地提供展示,因此这可以在几天内解决。
  • 转化级别的着陆页测试。 基准转化率2%,检测25%相对提升(0.5个百分点绝对):n ≈ 16 × 0.02 × 0.98 ÷ 0.005² ≈ 每个变体12,500次点击。按$0.40 CPC计算,这对单对页面来说是一个五位数测试。
测试内容 基准率 检测提升 每个变体样本
CTR(创意) 0.5% 20%相对提升 ~80,000次展示
CTR(创意) 0.5% 50%相对提升 ~13,000次展示
CVR(着陆页) 2% 25%相对提升 ~12,500次点击
CVR(着陆页) 2% 50%相对提升 ~3,100次点击
CVR(优惠页面) 5% 25%相对提升 ~4,900次点击

从该表中得出两个教训。首先,小提升极其昂贵:将可检测差异减半会使样本量翻四倍。其次,在展示级别测试的成本远低于点击级别。这种不对称性应塑造您的整个测试计划:在CTR级别测试创意角度,在转化级别测试漏斗,并且根本不要测试按钮颜色大小的变化——检测它们所需的样本很少能收回成本。

下限:整整一周,无论数学怎么说#

即使流量在两天内提供样本,也要至少运行七天。工作日和周末受众行为不同——不同的人、不同的设备、不同的意图。原生广告网络上的发布商组合随着新闻周期和内容日程变化而轮换,因此周二的流量不是周六的流量。转化延迟增加了第二个偏差:变体在周四的点击可能在周六转化,因此早期截断会系统性地偏向先获得展示的变体。在周中结束的测试采样了您真实流量的一个倾斜切片,“胜出者”可能只是工作日专精者。

上限:长时间测试从内部腐烂#

超过三到四周,A/B测试就不再是受控实验。创意疲劳会衰减两个变体——很少以相同速度衰减,这会在测试中期悄悄逆转排名。竞争对手进入和退出拍卖,改变您的流量质量。季节性因素在整个比较中漂移。如果公式表明您需要六周的流量,请将其视为一个裁决:您寻找的差异在您的流量水平下太小而无法检测。改为测试一个更大的变化——不同的钩子或角度、不同的漏斗结构——其中可检测差异大且样本可负担。

不要偷看——或者至少不要根据偷看采取行动#

经典失败模式:每天检查仪表板,并在数字首次看起来显著时宣布胜利。重复查看累积数据会大幅增加假阳性率——每天偷看的情况下,“在某个时刻达到显著性”的停止规则触发频率远高于宣称的5%错误率。然后均值回归解释了大多数“我的胜出者不再胜出”的抱怨:第二天领先的变体是在噪声上骑行,然后回落。纪律很简单:预先承诺样本量,仅将每日监控用于止损条件——跟踪损坏、花费失控、变体表现灾难性——并在最后一次性评估胜出者。

无法负担显著性时的终止规则#

大多数原生和联盟营销买家无法负担每个变体12,500次点击,假装否则会产生虚假的严谨性。诚实的替代方案是分阶段筛选——比显著性测试更粗糙,是每月测试数十个创意的买家的标准做法:

  1. CTR筛选(第1–3天)。 给每个创意几千次展示,然后淘汰所有明显低于平均水平的。您不是在证明什么——您是在筛选,以便预算集中在可能的胜出者上。
  2. 花费护栏(滚动)。 一个常见的从业者规则:暂停任何花费已达目标CPA 2–3倍且零转化的变体。这不是统计学;这是生存。
  3. 最终候选者的显著性。 一旦两三个幸存者承担了大部分花费,使用上述数学在它们之间进行适当的转化级别测试。您为一个真正的测试提供资金,而不是十个虚假的测试。

捷径:从已经存活的广告开始#

每个不需要测试的变体都是节省的钱,而关于什么有效的最便宜信息是竞争对手持续付费运行的广告。运行超过30天的广告每天都会通过其所有者的盈利检查。OpenAdLibrary的725,000+个在49个网络上的实时原生创意索引(2026年6月)记录了每个创意的首次和最后出现日期,这使广告寿命成为一个可筛选的信号,而非直觉——您垂直领域中的运行时间最长的原生广告是预测试的起点。围绕两三个已在实践中证明的角度构建您的测试,您是在测试胜出者的变体,而非冷猜测;您可以使用原生广告研究工具免费浏览实时竞争对手创意。更少、更好的变体意味着更小的样本、更短的测试以及更少的预算消耗在发现上。

一个端到端的工作示例#

假设您运行一个$60派发的线索生成优惠,有一个活动每天跨测试组提供约1,500次点击。

  • 创意阶段: 四个创意在CTR级别竞争。每个几千次展示在2–3天内解决;筛选出前两个。
  • 着陆页阶段: 两个着陆页在转化级别。基准CVR约为3%,检测30%相对提升(0.9个百分点绝对):n ≈ 16 × 0.03 × 0.97 ÷ 0.009² ≈ 每个变体5,700次点击,总共约11,400次。按每天1,500次点击计算,这是八天——加上周末覆盖,算一整周。
  • 结论: 一个测试周期从启动到可辩护的胜出者耗时10–12天,失败支出由护栏规则限制,而不是靠希望继续运行。

这就是“多久”的现实形状:几天廉价筛选,一周多有针对性的测量,以及由您的点击量决定的日历长度——而不是任何人的神奇天数。

常见问题

广告A/B测试中每个变体需要多少次转化?
作为经验法则,每个变体50–100次转化可以可靠地检测到较大差异(相对差异30%以上),而10–15%的小幅提升可能需要数千次转化。公式n ≈ 16 × p(1−p) ÷ d² 可根据您的基准率和您想检测的差异给出精确数字。如果您的流量在大约四周内无法达到该数字,则改为测试更大的创意变化。
广告A/B测试运行3天够吗?
不够。即使高流量活动在三天内收集了大量样本,您也只采样了每周周期的一部分——工作日和周末受众转化率不同,转化延迟意味着早期点击尚未完成转化。至少运行完整的七天。唯一的例外是早期CTR筛选,此时您是在筛选明显失败的广告,而非宣布统计上有效的胜出者。
应该以CTR还是转化率来测试广告?
两者兼顾,但分阶段进行。CTR级别的测试只需要展示量,成本低且速度快,因此用于早期淘汰表现不佳的创意。转化率测试衡量的是您实际付费的指标,但需要10–100倍的预算,因此仅用于最终候选广告以及着陆页或漏斗变更。在所有环节都进行转化率测试是小预算账户在消耗他们负担不起的严谨性。
如果A/B测试一达到显著性就停止,会怎样?
这会大幅提高假阳性率。每天检查并在首次出现显著结果时停止,意味着许多“胜出者”只是噪声,随着更多数据会回归均值——这是经典的偷看问题。预先承诺样本量,仅将每日检查用于止损条件,如跟踪损坏或花费失控,并在样本完成后一次性评估结果。
为什么测试后胜出的广告变体不再胜出?
通常是均值回归:变体早期的领先优势包含了运气成分,其长期表现更接近平均值。创意疲劳会加剧这种情况——新的胜出者随着受众反复看到而衰减。这两个原因都表明需要定期重新测试冠军广告,并将任何单个测试结果视为带有误差范围的估计值,而非永久性事实。
OpenAdLibrary 编辑团队
作者OpenAdLibrary 编辑团队
广告情报与原生广告研究

我们构建了 OpenAdLibrary,一个开放的广告透明度平台。我们的系统每日捕捉 Taboola、Outbrain、MGID、Revcontent、Teads、Yahoo 和 MSN 上的实时原生广告,识别每个广告背后的真实广告主,并追踪点击至其落地页。这些指南提炼了我们在数据中的发现,助您更快地研究市场动态。