广告A/B测试应运行多久:样本量数学实用指南
A/B测试时长是算术问题,而非经验法则:所需样本除以每日流量。以下是可用的样本量数学,以及保持测试经济性的下限、上限和终止规则。

运行广告A/B测试,直到每个变体收集到足够的转化次数,使您关心的差异变得可见——而不是固定天数。作为经验法则,这意味着至少一整周以覆盖工作日周期,以及50到几千次转化(每个变体),具体取决于您想检测的差异大小。时长是算术的输出结果,而非日历偏好:所需天数 = 每个变体所需样本 ÷ 每个变体每日流量。本文为您提供该算术、覆盖它的下限和上限,以及在数学表明您无法负担显著性时使用的更便宜的测试序列。
时长是输出结果,而非日历选择#
大多数建议给出固定答案——七天、十四天、一个月。天数是不对的单位。每天产生40次转化的活动大约一周内解决着陆页测试;同样的测试放在每天产生4次转化的活动上,需要两个多月,到那时结果已被期间发生的一切变化污染。三个输入决定您的实际时长:
- 您测试指标的基准率——创意使用CTR,着陆页和优惠使用转化率。
- 值得检测的最小差异。 检测10%的提升所需流量远多于检测50%的提升,而且大多数小提升不值得花费流量去发现。
- 每个变体的每日流量——由您的预算和出价决定。
确定前两个,所需样本通过公式得出。除以第三个,得到您的时长。如果答案超过大约四周,通常正确的做法是改变测试,而不是硬撑——下文详述。
样本量数学,无需统计学学位#
95%置信度和80%统计功效下双变体测试的标准简化公式:
每个变体n ≈ 16 × p × (1 − p) ÷ d²
其中p是您的小数形式基准率,d是您想检测的绝对差异。两个工作示例:
- CTR级别的创意测试。 基准CTR 0.5%,检测20%相对提升(0.1个百分点绝对):n ≈ 16 × 0.005 × 0.995 ÷ 0.001² ≈ 每个变体80,000次展示。原生广告位快速且廉价地提供展示,因此这可以在几天内解决。
- 转化级别的着陆页测试。 基准转化率2%,检测25%相对提升(0.5个百分点绝对):n ≈ 16 × 0.02 × 0.98 ÷ 0.005² ≈ 每个变体12,500次点击。按$0.40 CPC计算,这对单对页面来说是一个五位数测试。
| 测试内容 | 基准率 | 检测提升 | 每个变体样本 |
|---|---|---|---|
| CTR(创意) | 0.5% | 20%相对提升 | ~80,000次展示 |
| CTR(创意) | 0.5% | 50%相对提升 | ~13,000次展示 |
| CVR(着陆页) | 2% | 25%相对提升 | ~12,500次点击 |
| CVR(着陆页) | 2% | 50%相对提升 | ~3,100次点击 |
| CVR(优惠页面) | 5% | 25%相对提升 | ~4,900次点击 |
从该表中得出两个教训。首先,小提升极其昂贵:将可检测差异减半会使样本量翻四倍。其次,在展示级别测试的成本远低于点击级别。这种不对称性应塑造您的整个测试计划:在CTR级别测试创意角度,在转化级别测试漏斗,并且根本不要测试按钮颜色大小的变化——检测它们所需的样本很少能收回成本。
下限:整整一周,无论数学怎么说#
即使流量在两天内提供样本,也要至少运行七天。工作日和周末受众行为不同——不同的人、不同的设备、不同的意图。原生广告网络上的发布商组合随着新闻周期和内容日程变化而轮换,因此周二的流量不是周六的流量。转化延迟增加了第二个偏差:变体在周四的点击可能在周六转化,因此早期截断会系统性地偏向先获得展示的变体。在周中结束的测试采样了您真实流量的一个倾斜切片,“胜出者”可能只是工作日专精者。
上限:长时间测试从内部腐烂#
超过三到四周,A/B测试就不再是受控实验。创意疲劳会衰减两个变体——很少以相同速度衰减,这会在测试中期悄悄逆转排名。竞争对手进入和退出拍卖,改变您的流量质量。季节性因素在整个比较中漂移。如果公式表明您需要六周的流量,请将其视为一个裁决:您寻找的差异在您的流量水平下太小而无法检测。改为测试一个更大的变化——不同的钩子或角度、不同的漏斗结构——其中可检测差异大且样本可负担。
不要偷看——或者至少不要根据偷看采取行动#
经典失败模式:每天检查仪表板,并在数字首次看起来显著时宣布胜利。重复查看累积数据会大幅增加假阳性率——每天偷看的情况下,“在某个时刻达到显著性”的停止规则触发频率远高于宣称的5%错误率。然后均值回归解释了大多数“我的胜出者不再胜出”的抱怨:第二天领先的变体是在噪声上骑行,然后回落。纪律很简单:预先承诺样本量,仅将每日监控用于止损条件——跟踪损坏、花费失控、变体表现灾难性——并在最后一次性评估胜出者。
无法负担显著性时的终止规则#
大多数原生和联盟营销买家无法负担每个变体12,500次点击,假装否则会产生虚假的严谨性。诚实的替代方案是分阶段筛选——比显著性测试更粗糙,是每月测试数十个创意的买家的标准做法:
- CTR筛选(第1–3天)。 给每个创意几千次展示,然后淘汰所有明显低于平均水平的。您不是在证明什么——您是在筛选,以便预算集中在可能的胜出者上。
- 花费护栏(滚动)。 一个常见的从业者规则:暂停任何花费已达目标CPA 2–3倍且零转化的变体。这不是统计学;这是生存。
- 最终候选者的显著性。 一旦两三个幸存者承担了大部分花费,使用上述数学在它们之间进行适当的转化级别测试。您为一个真正的测试提供资金,而不是十个虚假的测试。
捷径:从已经存活的广告开始#
每个不需要测试的变体都是节省的钱,而关于什么有效的最便宜信息是竞争对手持续付费运行的广告。运行超过30天的广告每天都会通过其所有者的盈利检查。OpenAdLibrary的725,000+个在49个网络上的实时原生创意索引(2026年6月)记录了每个创意的首次和最后出现日期,这使广告寿命成为一个可筛选的信号,而非直觉——您垂直领域中的运行时间最长的原生广告是预测试的起点。围绕两三个已在实践中证明的角度构建您的测试,您是在测试胜出者的变体,而非冷猜测;您可以使用原生广告研究工具免费浏览实时竞争对手创意。更少、更好的变体意味着更小的样本、更短的测试以及更少的预算消耗在发现上。
一个端到端的工作示例#
假设您运行一个$60派发的线索生成优惠,有一个活动每天跨测试组提供约1,500次点击。
- 创意阶段: 四个创意在CTR级别竞争。每个几千次展示在2–3天内解决;筛选出前两个。
- 着陆页阶段: 两个着陆页在转化级别。基准CVR约为3%,检测30%相对提升(0.9个百分点绝对):n ≈ 16 × 0.03 × 0.97 ÷ 0.009² ≈ 每个变体5,700次点击,总共约11,400次。按每天1,500次点击计算,这是八天——加上周末覆盖,算一整周。
- 结论: 一个测试周期从启动到可辩护的胜出者耗时10–12天,失败支出由护栏规则限制,而不是靠希望继续运行。
这就是“多久”的现实形状:几天廉价筛选,一周多有针对性的测量,以及由您的点击量决定的日历长度——而不是任何人的神奇天数。







