ควรทดสอบโฆษณา A/B นานแค่ไหน: คณิตศาสตร์ขนาดตัวอย่างที่นำไปใช้ได้จริง
ระยะเวลาทดสอบ A/B คือการคำนวณ ไม่ใช่ความเชื่อลอย ๆ: ใช้ขนาดตัวอย่างที่ต้องการหารด้วยปริมาณรายวัน นี่คือคณิตศาสตร์ขนาดตัวอย่างที่ใช้งานได้จริง พร้อมกฎขั้นต่ำ ขีดจำกัดสูงสุด และกฎหยุดทดสอบที่ทำให้การทดสอบไม่แพงเกินไป

ทดสอบโฆษณา A/B จนกว่าแต่ละตัวแปรจะรวบรวมการแปลงได้มากพอที่จะทำให้ความแตกต่างที่คุณสนใจมองเห็นได้ — ไม่ใช่สำหรับจำนวนวันที่ตายตัว ตามหลักปฏิบัติทั่วไป นั่นหมายถึงอย่างน้อยหนึ่งสัปดาห์เต็มเพื่อครอบคลุมวงจรวันในสัปดาห์ และอยู่ระหว่าง 50 ถึงหลายพันการแปลงต่อตัวแปร ขึ้นอยู่กับว่าคุณต้องการตรวจจับความแตกต่างที่เล็กแค่ไหน ระยะเวลาเป็นผลลัพธ์ของการคำนวณ ไม่ใช่ความชอบตามปฏิทิน: วันที่ต้องการ = ขนาดตัวอย่างที่ต้องการต่อตัวแปร ÷ ปริมาณรายวันต่อตัวแปรของคุณ บทความนี้ให้คณิตศาสตร์นั้น กฎขั้นต่ำและขีดจำกัดสูงสุดที่ลบล้างมัน และลำดับการทดสอบที่ถูกกว่าเพื่อใช้เมื่อคณิตศาสตร์บอกว่าคุณจ่ายค่าความมีนัยสำคัญไม่ไหว
ระยะเวลาเป็นผลลัพธ์ ไม่ใช่ตัวเลือกตามปฏิทิน#
คำแนะนำส่วนใหญ่ให้คำตอบตายตัวแก่คุณ — เจ็ดวัน สิบสี่วัน หนึ่งเดือน วันเป็นหน่วยที่ผิด แคมเปญที่สร้างการแปลงวันละ 40 ครั้งสามารถตัดสินการทดสอบหน้าแลนดิ้งได้ในประมาณหนึ่งสัปดาห์ การทดสอบเดียวกันบนแคมเปญที่สร้างการแปลงวันละ 4 ครั้งใช้เวลากว่าสองเดือน ซึ่งผลลัพธ์จะปนเปื้อนกับทุกสิ่งที่เปลี่ยนแปลงในระหว่างนั้น สามปัจจัยกำหนดระยะเวลาจริงของคุณ:
- อัตราพื้นฐาน ของเมตริกที่คุณกำลังทดสอบ — CTR สำหรับครีเอทีฟ อัตราการแปลง สำหรับหน้าแลนดิ้งและข้อเสนอ
- ความแตกต่างที่เล็กที่สุดที่คุ้มค่าตรวจพบ การตรวจจับการเพิ่มขึ้น 10% ใช้ปริมาณการเข้าชมแพงกว่าการตรวจจับการเพิ่มขึ้น 50% มาก และการเพิ่มขึ้นเล็กน้อยส่วนใหญ่ไม่คุ้มค่ากับเงินที่ใช้เพื่อเห็นมัน
- ปริมาณรายวันต่อตัวแปร — กำหนดโดยงบประมาณและการประมูลของคุณ
กำหนดสองปัจจัยแรกและขนาดตัวอย่างที่ต้องการจะได้จากสูตร หารด้วยปัจจัยที่สามและคุณก็ได้ระยะเวลาของคุณ หากคำตอบออกมายาวกว่าประมาณสี่สัปดาห์ การเคลื่อนไหวที่ถูกต้องมักจะเปลี่ยนการทดสอบ ไม่ใช่ฝืนทำต่อไป — ดูเพิ่มเติมด้านล่าง
คณิตศาสตร์ขนาดตัวอย่าง ลบปริญญาสถิติออก#
ทางลัดมาตรฐานสำหรับการทดสอบสองตัวแปรที่ความมั่นใจ 95% และพลัง 80%:
n ต่อตัวแปร ≈ 16 × p × (1 − p) ÷ d²
โดยที่ p คืออัตราพื้นฐานของคุณในรูปทศนิยม และ d คือความแตกต่างสัมบูรณ์ที่คุณต้องการตรวจจับ ตัวอย่างการคำนวณสองตัวอย่าง:
- การทดสอบครีเอทีฟในระดับ CTR อัตราพื้นฐาน CTR 0.5% ตรวจจับการเพิ่มขึ้นสัมพัทธ์ 20% (0.1 จุดสัมบูรณ์): n ≈ 16 × 0.005 × 0.995 ÷ 0.001² ≈ 80,000 อิมเพรสชันต่อตัวแปร แพลตฟอร์มเนทีฟเสิร์ฟอิมเพรสชันเร็วและราคาถูก ดังนั้นนี่สามารถตัดสินได้ในไม่กี่วัน
- การทดสอบหน้าแลนดิ้งในระดับการแปลง อัตราการแปลงพื้นฐาน 2% ตรวจจับการเพิ่มขึ้นสัมพัทธ์ 25% (0.5 จุดสัมบูรณ์): n ≈ 16 × 0.02 × 0.98 ÷ 0.005² ≈ 12,500 คลิกต่อตัวแปร ที่ CPC $0.40 นี่คือการทดสอบห้าหลักสำหรับคู่หน้าเว็บเดียว
| สิ่งที่คุณกำลังทดสอบ | อัตราพื้นฐาน | การเพิ่มขึ้นที่ตรวจจับ | ตัวอย่างต่อตัวแปร |
|---|---|---|---|
| CTR (ครีเอทีฟ) | 0.5% | 20% สัมพัทธ์ | ~80,000 อิมเพรสชัน |
| CTR (ครีเอทีฟ) | 0.5% | 50% สัมพัทธ์ | ~13,000 อิมเพรสชัน |
| CVR (หน้าแลนดิ้ง) | 2% | 25% สัมพัทธ์ | ~12,500 คลิก |
| CVR (หน้าแลนดิ้ง) | 2% | 50% สัมพัทธ์ | ~3,100 คลิก |
| CVR (หน้าข้อเสนอ) | 5% | 25% สัมพัทธ์ | ~4,900 คลิก |
บทเรียนสองประการเกิดขึ้นจากตารางนั้น ประการแรก การเพิ่มขึ้นเล็กน้อยมีราคาแพงอย่างโหดร้าย: การลดความแตกต่างที่ตรวจจับได้ลงครึ่งหนึ่งทำให้ขนาดตัวอย่างเพิ่มขึ้นสี่เท่า ประการที่สอง การทดสอบในระดับอิมเพรสชันมีค่าใช้จ่ายเพียงเศษเสี้ยวเล็กน้อยของการทดสอบในระดับคลิก ความไม่สมมาตรนั้นควรกำหนดโปรแกรมการทดสอบทั้งหมดของคุณ: ทดสอบแนวคิดครีเอทีฟในระดับ CTR ทดสอบฟันเนลในระดับการแปลง และอย่าทดสอบการเปลี่ยนแปลงขนาดเล็กเหมือนสีปุ่ม — ขนาดตัวอย่างที่ต้องการเพื่อตรวจจับพวกมันนั้นแทบไม่คุ้มค่า
ขั้นต่ำ: หนึ่งสัปดาห์เต็ม ไม่ว่าคณิตศาสตร์จะบอกอะไร#
แม้ปริมาณจะส่งมอบตัวอย่างของคุณในสองวัน ให้ทดสอบอย่างน้อยเจ็ดวัน ผู้ชมในวันธรรมดาและวันหยุดสุดสัปดาห์มีพฤติกรรมต่างกัน — คนต่างกัน อุปกรณ์ต่างกัน ความตั้งใจต่างกัน ส่วนผสมของผู้เผยแพร่บนเครือข่ายเนทีฟหมุนเวียนตลอดสัปดาห์เมื่อวงจรข่าวและตารางเนื้อหาเปลี่ยน ดังนั้นการเข้าชมวันอังคารจึงไม่ใช่การเข้าชมวันเสาร์ ความล่าช้าในการแปลงเพิ่มอคติประการที่สอง: คลิกวันพฤหัสบดีของตัวแปรอาจแปลงในวันเสาร์ ดังนั้นการตัดสินใจเร็วจึงให้ความได้เปรียบอย่างเป็นระบบกับตัวแปรที่บังเอิญได้อิมเพรสชันก่อน การทดสอบที่สิ้นสุดกลางสัปดาห์ได้สุ่มตัวอย่างส่วนที่บิดเบี้ยวของการเข้าชมจริงของคุณ และ "ผู้ชนะ" อาจเป็นเพียงผู้เชี่ยวชาญวันธรรมดา
ขีดจำกัดสูงสุด: การทดสอบที่ยาวนานจะเสื่อมสภาพจากภายใน#
เกินสามถึงสี่สัปดาห์ การทดสอบ A/B หยุดเป็นการทดลองที่ควบคุมได้ Creative fatigue ทำให้ทั้งสองตัวแปรเสื่อมลง — แทบไม่เคยเกิดขึ้นด้วยความเร็วเดียวกัน ซึ่งกลับอันดับกลางการทดสอบอย่างเงียบ ๆ คู่แข่งเข้าออกการประมูลและเปลี่ยนคุณภาพการเข้าชมของคุณ ฤดูกาลเปลี่ยนแปลงอยู่ใต้การเปรียบเทียบทั้งหมด หากสูตรบอกว่าคุณต้องการการเข้าชมหกสัปดาห์ จงอ่านนั่นเป็นคำตัดสิน: ความแตกต่างที่คุณกำลังล่านั้นเล็กเกินไปที่จะตรวจจับได้ที่ปริมาณของคุณ ให้ทดสอบการเปลี่ยนแปลงที่ใหญ่กว่าแทน — hook หรือ angle ที่ต่างกัน โครงสร้างฟันเนลที่ต่างกัน — ที่ซึ่งความแตกต่างที่ตรวจจับได้มีขนาดใหญ่และตัวอย่างมีราคาไม่แพง
อย่าแอบดู — หรืออย่างน้อยอย่าทำตามสิ่งที่แอบดู#
รูปแบบความล้มเหลวคลาสสิก: ตรวจสอบแดชบอร์ดทุกวันและประกาศชัยชนะในวันแรกที่ตัวเลขดูมีนัยสำคัญ การมองข้อมูลที่สะสมซ้ำ ๆ เพิ่มผลบวกลวงอย่างมาก — ด้วยการแอบดูรายวัน กฎหยุด "มันมีนัยสำคัญในบางจุด" จะเกิดขึ้นบ่อยกว่าอัตราความผิดพลาด 5% ที่โฆษณา การถดถอยสู่ค่าเฉลี่ยจากนั้นอธิบายข้อร้องเรียน "ผู้ชนะของฉันหยุดชนะ" ส่วนใหญ่: ตัวแปรที่กระโดดนำในวันที่สองกำลังขี่สัญญาณรบกวน และมันจะลอยกลับมา วินัยนั้นง่าย: กำหนดขนาดตัวอย่างล่วงหน้า ตรวจสอบรายวันเฉพาะสำหรับเงื่อนไขหยุดขาดทุน — การติดตามพัง การใช้จ่ายเกินควบคุม ตัวแปรที่ทำผลงานย่ำแย่ — และประเมินผู้ชนะเพียงครั้งเดียว เมื่อสิ้นสุด
กฎหยุดทดสอบสำหรับเมื่อคุณจ่ายค่าความมีนัยสำคัญไม่ไหว#
ผู้ซื้อเนทีฟและแอฟฟิลิเอทส่วนใหญ่ไม่สามารถจัดหาเงิน 12,500 คลิกต่อตัวแปรได้ และการแสร้งทำเป็นว่าทำได้ทำให้เกิดความเข้มงวดปลอม ทางเลือกที่ซื่อสัตย์คือการคัดกรองเป็นขั้นตอน — หยาบกว่าการทดสอบความมีนัยสำคัญ และเป็นวิธีปฏิบัติมาตรฐานในหมู่ผู้ซื้อที่ทดสอบครีเอทีฟหลายสิบชิ้นต่อเดือน:
- คัดกรองด้วย CTR (วัน 1–3) ให้ครีเอทีฟแต่ละชิ้นได้อิมเพรสชันสองสามพันครั้ง จากนั้นฆ่าทุกชิ้นที่ต่ำกว่ากลุ่มอย่างชัดเจน คุณไม่ได้พิสูจน์อะไร — คุณกำลังคัดกรองเพื่อให้งบประมาณรวมศูนย์กับผู้ชนะที่น่าจะเป็นไปได้
- ราคาคุ้มครองการใช้จ่าย (ต่อเนื่อง) กฎปฏิบัติทั่วไปทั่วไป: หยุดตัวแปรใด ๆ ที่ใช้จ่ายไป 2–3× CPA เป้าหมายของคุณโดยไม่มีการแปลงเลย นั่นไม่ใช่สถิติ; มันคือการเอาชีวิตรอด
- ความมีนัยสำคัญสำหรับผู้เข้ารอบสุดท้าย เมื่อผู้รอดชีวิตสองหรือสามคนแบกรับการใช้จ่ายส่วนใหญ่แล้ว ให้ทำการทดสอบระดับการแปลงที่เหมาะสมระหว่างพวกเขาโดยใช้คณิตศาสตร์ข้างต้น คุณจัดหาเงินให้กับการทดสอบจริงหนึ่งครั้งแทนที่จะเป็นสิบครั้งปลอม
ลัดขนาดตัวอย่าง: เริ่มจากโฆษณาที่รอดมาแล้ว#
ทุกตัวแปรที่คุณไม่จำเป็นต้องทดสอบคือเงินที่ประหยัดได้ และข้อมูลที่ถูกที่สุดเกี่ยวกับสิ่งที่ได้ผลคือสิ่งที่คู่แข่งยังคงจ่ายเงินเพื่อดำเนินการต่อไป โฆษณาที่วิ่งมา 30+ วันได้ผ่านการตรวจสอบความสามารถในการทำกำไรของเจ้าของทุกวันของการรันนั้น ดัชนีของ OpenAdLibrary ที่มีครีเอทีฟเนทีฟสดมากกว่า 725,000 รายการทั่ว 49 เครือข่าย (มิถุนายน 2026) บันทึกวันที่พบครั้งแรกและครั้งล่าสุดสำหรับทุกครีเอทีฟ ซึ่งเปลี่ยน ad longevity ให้เป็นสัญญาณที่กรองได้แทนที่จะเป็นความรู้สึก — โฆษณาเนทีฟที่วิ่งยาวนานที่สุด ในอุตสาหกรรมของคุณคือจุดเริ่มต้นที่ผ่านการทดสอบล่วงหน้าแล้ว สร้างการทดสอบของคุณรอบสองหรือสาม angle ที่พิสูจน์แล้วในสนามจริง และคุณกำลังทดสอบรูปแบบต่าง ๆ ของผู้ชนะแทนที่จะเป็นการเดาแบบสุ่ม คุณสามารถเรียกดูครีเอทีฟสดของคู่แข่งได้ฟรีด้วย เครื่องมือวิจัยโฆษณาเนทีฟ ตัวแปรที่น้อยลงและดีขึ้นหมายถึงตัวอย่างที่เล็กลง การทดสอบที่สั้นลง และงบประมาณที่เผาไปกับการค้นพบน้อยลง
ตัวอย่างการทำงานตั้งแต่ต้นจนจบ#
สมมติว่าคุณรันข้อเสนอ lead-gen ที่จ่าย $60 โดยมีแคมเปญหนึ่งทำคลิกราว 1,500 ครั้งต่อวันทั่วเซลล์ทดสอบของคุณ
- ขั้นครีเอทีฟ: ครีเอทีฟสี่ชิ้นแข่งขันในระดับ CTR อิมเพรสชันสองสามพันครั้งต่อชิ้นตัดสินได้ใน 2–3 วัน; คัดเหลือสองอันดับแรก
- ขั้นหน้าแลนดิ้ง: หน้าแลนดิ้งสองหน้าในระดับการแปลง อัตรา CVR พื้นฐานประมาณ 3% ตรวจจับการเพิ่มขึ้นสัมพัทธ์ 30% (0.9 จุดสัมบูรณ์): n ≈ 16 × 0.03 × 0.97 ÷ 0.009² ≈ 5,700 คลิกต่อตัวแปร รวมประมาณ 11,400 คลิก ที่ 1,500 คลิกต่อวัน นั่นคือแปดวัน — เรียกได้ว่าหนึ่งสัปดาห์เต็มบวกครอบคลุมวันหยุด
- คำตัดสิน: หนึ่งรอบการทดสอบใช้เวลา 10–12 วันจากการเปิดตัวไปจนถึงผู้ชนะที่สามารถปกป้องได้ โดยมีการใช้จ่ายที่แพ้ถูกจำกัดด้วยกฎราคาคุ้มครองแทนที่จะปล่อยให้รันต่อไปด้วยความหวัง
นั่นคือรูปร่างที่สมจริงของ "นานแค่ไหน": ไม่กี่วันของการคัดกรองราคาถูก หนึ่งสัปดาห์บวกของการวัดผลแบบเน้น และความยาวตามปฏิทินที่กำหนดโดยปริมาณคลิกของคุณ — ไม่ใช่ด้วยจำนวนวันวิเศษของใคร







