広告A/Bテストの実施期間:サンプルサイズ計算を実用的に
A/Bテストの期間は算術であり、伝承ではない:必要なサンプルをデイリーボリュームで割る。ここでは実用的なサンプルサイズ計算と、テストを手頃に保つための下限、上限、キルルールを紹介。

広告A/Bテストは、各バリアントが気になる差異を可視化するのに十分なコンバージョンを収集するまで実行する。固定日数ではない。経験則として、少なくとも1週間は曜日サイクルをカバーし、検出したい差異の大きさに応じてバリアントあたり50から数千のコンバージョンが必要となる。期間は算術の出力であり、カレンダーの好みではない:必要な日数 = バリアントあたりの必要サンプル ÷ 1日あたりのバリアントボリューム。本記事ではその算術、それを上書きする下限と上限、そして数学的に有意性が負担できない場合に使用するより安価なテストシーケンスを提供する。
期間は出力であり、カレンダーの選択ではない#
ほとんどのアドバイスは固定の答えを提示する—7日間、14日間、1ヶ月。日数は間違った単位だ。1日あたり40件のコンバージョンを生成するキャンペーンではランダーテストが約1週間で解決するが、同じテストを1日4件のキャンペーンで行うと2ヶ月以上かかり、その間に変更されたすべての要素で結果が汚染される。実際の期間を決定する3つの入力要素:
- テストする指標のベースライン率 — クリエイティブのCTR、ランダーとオファーのコンバージョン率。
- 検出する価値のある最小の差。 10%のリフトを検出するには50%のリフトを検出するよりもはるかに多くのトラフィックが必要であり、ほとんどの小さなリフトはそれを見るための支出に見合わない。
- バリアントあたりのデイリーボリューム — 予算と入札価格によって決まる。
最初の2つを固定すれば、必要サンプルは計算式から導き出される。3番目で割れば期間が得られる。答えが約4週間より長くなる場合、通常はテストを継続するのではなく変更するのが正しい対応である——詳細は後述。
統計学の学位なしで使えるサンプルサイズ計算#
95%信頼度、80%検出力での2バリアントテストの標準的なショートカット:
n バリアントあたり ≈ 16 × p × (1 − p) ÷ d²
ここで p はベースライン率(小数)、d は検出したい絶対差。2つの実例:
- CTRレベルのクリエイティブテスト。 ベースラインCTR 0.5%、相対リフト20%(絶対0.1ポイント)を検出:n ≈ 16 × 0.005 × 0.995 ÷ 0.001² ≈ バリアントあたり約80,000インプレッション。ネイティブプレースメントはインプレッションを高速かつ安価に提供するため、数日で解決可能。
- コンバージョンレベルのランダーテスト。 ベースラインコンバージョン率2%、相対リフト25%(絶対0.5ポイント)を検出:n ≈ 16 × 0.02 × 0.98 ÷ 0.005² ≈ バリアントあたり約12,500クリック。CPCが0.40ドルの場合、1組のページに対して5桁のテストとなる。
| テスト対象 | ベースライン | 検出するリフト | バリアントあたりのサンプル |
|---|---|---|---|
| CTR(クリエイティブ) | 0.5% | 20%相対 | 約80,000インプレッション |
| CTR(クリエイティブ) | 0.5% | 50%相対 | 約13,000インプレッション |
| CVR(ランダー) | 2% | 25%相対 | 約12,500クリック |
| CVR(ランダー) | 2% | 50%相対 | 約3,100クリック |
| CVR(オファーページ) | 5% | 25%相対 | 約4,900クリック |
その表から2つの教訓が得られる。第一に、小さなリフトは非常に高くつく:検出可能な差を半分にするとサンプルは4倍になる。第二に、インプレッションレベルでのテストはクリックレベルでのテストのごく一部のコストで済む。この非対称性がテストプログラム全体を形作るべきだ:クリエイティブの角度はCTRレベルでテストし、ファネルはコンバージョンレベルでテストし、ボタンの色サイズの変更はテストしない——検出に必要なサンプルはそれ自体のコストを回収することは稀だからだ。
下限:計算結果に関わらず、最低1週間#
ボリュームが2日でサンプルを提供する場合でも、最低7日間は実行する。平日と週末のオーディエンスは異なる行動をとる——異なる人々、異なるデバイス、異なる意図。ネイティブネットワーク上のパブリッシャーミックスはニュースサイクルとコンテンツスケジュールに応じて週を通じて変化するため、火曜日のトラフィックは土曜日のトラフィックと同じではない。コンバージョンラグが第二のバイアスを加える:あるバリアントの木曜日のクリックは土曜日にコンバージョンする可能性があるため、早期の打ち切りは、どちらかのバリアントが先にインプレッションを得たかを体系的に有利にする。週の途中で終了するテストは実際のトラフィックの偏った部分をサンプリングしており、「勝者」は単に平日の専門家である可能性がある。
上限:長期テストは内部から腐敗する#
3〜4週間を過ぎると、A/Bテストは制御された実験ではなくなる。クリエイティブ疲労は両方のバリアントを劣化させる——大抵同じ速度ではなく、静かにテスト途中で順位を逆転させる。競合他社がオークションに出入りし、トラフィックの品質を変動させる。季節性が比較の下で全体として変化する。計算式が6週間のトラフィックを必要とする場合、それは判断として読むべきだ:追求している差は現在のボリュームでは検出するには小さすぎる。代わりに大きな振り幅をテストする——異なるフックや角度、異なるファネル構造——検出可能な差が大きく、サンプルが手頃なものにする。
覗き見をするな——少なくとも覗き見に基づいて行動するな#
典型的な失敗パターン:ダッシュボードを毎日チェックし、数字が有意に見えた最初の日に勝利を宣言する。蓄積データを繰り返し見ると偽陽性が劇的に増加する——毎日の覗き見では、「ある時点で有意になった」という停止ルールは、宣伝されている5%のエラー率よりもはるかに頻繁に発動する。平均への回帰が、その後「勝者が勝たなくなった」という苦情のほとんどを説明する:2日目に先に進んだバリアントはノイズに乗っていただけで、後退する。規律はシンプル:事前にサンプルサイズをコミットし、日次チェックはストップロス条件——トラッキングの破損、支出の暴走、バリアントの壊滅的なパフォーマンス——にのみ使用し、勝者は最後に一度だけ評価する。
有意性が負担できない場合のキルルール#
ほとんどのネイティブおよびアフィリエイトバイヤーは、バリアントあたり12,500クリックの資金を調達できず、そうでないふりをすると偽の厳密さが生まれる。正直な代替案は段階的な選別である——有意性テストより粗いが、月に数十のクリエイティブをテストするバイヤーの間で標準的なプラクティス:
- CTR選別(1〜3日目)。 各クリエイティブに数千のインプレッションを与え、明らかにグループを下回るものをすべてキルする。何かを証明しているわけではない——予算が有望な勝者に集中するようにトリアージしているのだ。
- 支出ガードレール(継続的)。 一般的な実務者のルール:ゼロコンバージョンで目標CPAの2〜3倍を費やしたバリアントを一時停止する。それは統計ではなく、生存だ。
- 最終候補の有意性。 2〜3の生存者が支出の大半を担うようになったら、上記の計算式を使用してそれらの間で適切なコンバージョンレベルのテストを実行する。10の偽のテストではなく、1つの本当のテストに資金を提供する。
サンプルを節約:既に生き残った広告から始める#
テストする必要のないバリアントは節約された資金であり、何が機能するかについての最も安価な情報は、競合他社が支払い続けて実行している広告である。30日以上実行されている広告は、その実行期間の毎日、所有者の収益性チェックを通過している。OpenAdLibraryの725,000以上のライブネイティブクリエイティブ(2026年6月時点、49ネットワーク)のインデックスは、すべてのクリエイティブのファーストシーンとラストシーンの日付を記録しており、広告の寿命を直感ではなくフィルタリング可能なシグナルに変える——あなたのバーティカルにおける最長実行ネイティブ広告は、事前テスト済みのスターティンググリッドである。すでに自然環境で証明された角度を持つ2〜3のバリエーションをテストに組み込めば、冷たい推測ではなく勝者のバリエーションをテストしていることになる。ネイティブ広告調査ツールでライブの競合クリエイティブを無料でブラウズできる。より少ない、より良いバリアントは、より小さなサンプル、より短いテスト、そして発見に費やす予算の削減を意味する。
エンドツーエンドの実例#
あなたが60ドルのペイアウトのリードジェンオファーを運営しており、テストセル全体で1日あたり約1,500クリックを生成する1つのキャンペーンがあるとしよう。
- クリエイティブ段階: 4つのクリエイティブがCTRレベルで競合。それぞれ数千インプレッションで2〜3日で解決。上位2つに選別。
- ランダー段階: 2つのランダーがコンバージョンレベルで競合。ベースラインCVR約3%、相対リフト30%(絶対0.9ポイント)を検出:n ≈ 16 × 0.03 × 0.97 ÷ 0.009² ≈ バリアントあたり約5,700クリック、合計約11,400クリック。1日1,500クリックで8日間——週末をカバーする1週間と呼ぶ。
- 判定: 1つのテストサイクルは、ローンチから防御可能な勝者まで10〜12日間実行され、負けている支出はガードレールルールによって制限され、希望に任せて実行され続けることはない。
それが「どのくらいの期間」の現実的な形だ:安価なトリアージの数日、集中測定の1週間以上、そしてあなたのクリックボリュームによって決まるカレンダー期間——誰かの魔法の日数ではない。







