Thời gian chạy thử nghiệm A/B quảng cáo: Toán học kích thước mẫu thực tiễn
Thời gian thử nghiệm A/B là phép tính, không phải truyền thuyết: mẫu cần thiết chia cho khối lượng hàng ngày. Dưới đây là toán học kích thước mẫu được áp dụng, cùng với các mức tối thiểu, tối đa và quy tắc dừng giúp thử nghiệm vừa túi tiền.

Chạy thử nghiệm A/B quảng cáo cho đến khi mỗi biến thể thu thập đủ chuyển đổi để sự khác biệt bạn quan tâm trở nên rõ ràng — không phải dựa trên số ngày cố định. Theo quy tắc thực tiễn, điều này có nghĩa là ít nhất một tuần đầy đủ để bao phủ các chu kỳ ngày trong tuần, và từ 50 đến vài nghìn chuyển đổi mỗi biến thể tùy thuộc vào mức chênh lệch nhỏ mà bạn muốn phát hiện. Thời gian là kết quả của phép tính, không phải sở thích lịch: ngày cần = mẫu yêu cầu mỗi biến thể ÷ khối lượng hàng ngày mỗi biến thể. Bài viết này cung cấp cho bạn phép tính đó, các mức tối thiểu và tối đa ghi đè lên nó, và chuỗi thử nghiệm rẻ hơn khi toán học cho thấy bạn không thể chi trả cho ý nghĩa thống kê.
Thời gian là kết quả, không phải lựa chọn lịch#
Hầu hết các lời khuyên đưa ra một câu trả lời cố định — bảy ngày, mười bốn ngày, một tháng. Ngày là đơn vị sai. Một chiến dịch tạo ra 40 chuyển đổi mỗi ngày giải quyết thử nghiệm landing page trong khoảng một tuần; cùng một thử nghiệm trên chiến dịch tạo 4 chuyển đổi mỗi ngày mất hơn hai tháng, và vào thời điểm đó kết quả đã bị nhiễu bởi mọi thay đổi xảy ra trong khoảng thời gian đó. Ba yếu tố quyết định thời gian thực tế của bạn:
- Tỷ lệ cơ sở của chỉ số bạn đang thử nghiệm — CTR cho sáng tạo, conversion rate cho landing page và đề nghị.
- Sự khác biệt nhỏ nhất đáng phát hiện. Phát hiện tăng 10% tốn nhiều lưu lượng hơn nhiều so với phát hiện tăng 50%, và hầu hết các tăng nhỏ không đáng để chi tiêu để thấy chúng.
- Khối lượng hàng ngày mỗi biến thể — được xác định bởi ngân sách và giá thầu của bạn.
Cố định hai yếu tố đầu tiên và mẫu yêu cầu sẽ xuất hiện từ công thức. Chia cho yếu tố thứ ba và bạn có thời gian của mình. Nếu câu trả lời dài hơn khoảng bốn tuần, bước đi đúng thường là thay đổi thử nghiệm, không phải kéo dài nó — sẽ có phần giải thích chi tiết bên dưới.
Toán học kích thước mẫu, không cần bằng cấp thống kê#
Công thức rút gọn tiêu chuẩn cho thử nghiệm hai biến thể với độ tin cậy 95% và sức mạnh 80%:
n mỗi biến thể ≈ 16 × p × (1 − p) ÷ d²
trong đó p là tỷ lệ cơ sở của bạn dưới dạng thập phân và d là chênh lệch tuyệt đối bạn muốn phát hiện. Hai ví dụ thực tế:
- Thử nghiệm sáng tạo ở mức CTR. CTR cơ sở 0.5%, phát hiện tăng 20% tương đối (0.1 điểm tuyệt đối): n ≈ 16 × 0.005 × 0.995 ÷ 0.001² ≈ 80,000 impressions per variant. Các vị trí native cung cấp lượt hiển thị nhanh và rẻ, vì vậy có thể giải quyết trong vài ngày.
- Thử nghiệm landing page ở mức chuyển đổi. Tỷ lệ chuyển đổi cơ sở 2%, phát hiện tăng 25% tương đối (0.5 điểm tuyệt đối): n ≈ 16 × 0.02 × 0.98 ÷ 0.005² ≈ 12,500 clicks per variant. Với CPC $0.40, đó là một thử nghiệm năm chữ số cho một cặp trang.
| What you're testing | Baseline | Lift to detect | Sample per variant |
|---|---|---|---|
| CTR (creative) | 0.5% | 20% relative | ~80,000 impressions |
| CTR (creative) | 0.5% | 50% relative | ~13,000 impressions |
| CVR (lander) | 2% | 25% relative | ~12,500 clicks |
| CVR (lander) | 2% | 50% relative | ~3,100 clicks |
| CVR (offer page) | 5% | 25% relative | ~4,900 clicks |
Hai bài học rút ra từ bảng này. Thứ nhất, các tăng nhỏ rất tốn kém: giảm một nửa mức chênh lệch có thể phát hiện sẽ làm tăng gấp bốn mẫu. Thứ hai, thử nghiệm ở mức hiển thị tốn một phần rất nhỏ so với thử nghiệm ở mức click. Sự bất đối xứng này nên định hình toàn bộ chương trình thử nghiệm của bạn: thử nghiệm góc sáng tạo ở mức CTR, thử nghiệm phễu ở mức chuyển đổi, và không thử nghiệm các thay đổi nhỏ như màu nút — mẫu cần để phát hiện chúng hiếm khi tự bù đắp chi phí.
Mức tối thiểu: một tuần đầy đủ, bất kể toán học nói gì#
Ngay cả khi khối lượng cung cấp mẫu trong hai ngày, hãy chạy ít nhất bảy ngày. Khán giả ngày thường và cuối tuần hành xử khác nhau — người khác, thiết bị khác, ý định khác. Hỗn hợp nhà xuất bản trên các mạng native quay vòng trong tuần khi chu kỳ tin tức và lịch nội dung thay đổi, vì vậy lưu lượng vào thứ Ba không giống lưu lượng vào thứ Bảy. Độ trễ chuyển đổi thêm một độ lệch thứ hai: các click vào thứ Năm có thể chuyển đổi vào thứ Bảy, vì vậy việc cắt sớm sẽ thiên vị biến thể nào nhận được ấn tượng đầu tiên. Một thử nghiệm kết thúc giữa tuần sẽ chỉ lấy mẫu một phần lệch của lưu lượng thực tế, và "người thắng" có thể chỉ là chuyên gia ngày trong tuần.
Mức tối đa: các thử nghiệm dài lâu sẽ suy giảm từ bên trong#
Sau ba đến bốn tuần, một thử nghiệm A/B không còn là một thí nghiệm kiểm soát. Creative fatigue làm giảm cả hai biến thể — hiếm khi cùng tốc độ, điều này âm thầm đảo ngược thứ hạng giữa chừng. Các đối thủ tham gia và rời khỏi đấu giá, làm thay đổi chất lượng lưu lượng của bạn. Tính mùa vụ trôi dạt dưới toàn bộ so sánh. Nếu công thức cho bạn thấy cần sáu tuần lưu lượng, hãy đọc đó như một phán quyết: sự khác biệt bạn đang săn lùng quá nhỏ để phát hiện với khối lượng hiện tại. Thay vào đó, thử một swing lớn hơn — một hook or angle khác, một cấu trúc phễu khác — nơi sự khác biệt có thể phát hiện lớn và mẫu có thể chi trả.
Đừng nhìn trộm — hoặc ít nhất đừng hành động dựa trên những lần nhìn trộm#
Chế độ thất bại cổ điển: kiểm tra bảng điều khiển hàng ngày và công bố chiến thắng ngay ngày đầu tiên số liệu có vẻ có ý nghĩa. Việc nhìn lại dữ liệu tích lũy thường xuyên làm tăng dương tính giả một cách đáng kể — với việc nhìn trộm hàng ngày, quy tắc dừng "đạt ý nghĩa ở một thời điểm nào đó" sẽ kích hoạt thường xuyên hơn mức lỗi 5% được quảng cáo. Hồi quy về trung bình sau đó giải thích hầu hết các phàn nàn "người thắng của tôi đã ngừng thắng": biến thể bứt phá vào ngày thứ hai chỉ đang dựa trên nhiễu, và nó sẽ quay lại. Kỷ luật rất đơn giản: cam kết trước kích thước mẫu, giám sát hàng ngày chỉ cho các điều kiện dừng lỗ — theo dõi bị hỏng, chi tiêu vượt mức, một biến thể hoạt động thảm họa — và đánh giá người thắng một lần duy nhất, vào cuối.
Quy tắc dừng khi bạn không thể chi trả cho ý nghĩa thống kê#
Hầu hết các nhà mua native và affiliate không thể tài trợ 12,500 click mỗi biến thể, và giả vờ có khả năng sẽ tạo ra sự nghiêm ngặt giả. Lựa chọn trung thực là cắt giảm theo giai đoạn — thô hơn so với thử nghiệm ý nghĩa, và là thực tiễn tiêu chuẩn trong số những người mua thử nghiệm hàng chục sáng tạo mỗi tháng:
- CTR cull (ngày 1–3). Cung cấp cho mỗi sáng tạo vài nghìn lượt hiển thị, sau đó loại bỏ mọi thứ rõ ràng dưới mức trung bình. Bạn không chứng minh gì — bạn đang triage để ngân sách tập trung vào những người thắng khả dĩ.
- Spend guardrail (luân chuyển). Một quy tắc thực hành phổ biến: tạm dừng bất kỳ biến thể nào đã chi 2–3× mục tiêu CPA mà không có chuyển đổi. Đó không phải là thống kê; đó là sinh tồn.
- Significance on the finalists. Khi hai hoặc ba người sống còn chiếm phần lớn chi tiêu, chạy một thử nghiệm mức chuyển đổi thực sự giữa chúng bằng công thức trên. Bạn tài trợ một thử nghiệm thực tế thay vì mười thử nghiệm giả.
Rút ngắn mẫu: bắt đầu từ các quảng cáo đã tồn tại#
Mỗi biến thể bạn không cần thử nghiệm là một khoản tiền tiết kiệm, và thông tin rẻ nhất về những gì hoạt động là những gì đối thủ vẫn trả tiền để chạy. Một quảng cáo đã chạy hơn 30 ngày đã vượt qua kiểm tra lợi nhuận của chủ sở hữu mỗi ngày. Chỉ mục OpenAdLibrary với hơn 725,000 sáng tạo native đang hoạt động trên 49 mạng (tháng 6/2026) ghi lại ngày xuất hiện và ngày cuối cùng cho mỗi sáng tạo, biến ad longevity thành một tín hiệu có thể lọc thay vì một cảm tính — các longest-running native ads trong ngành của bạn là một lưới khởi đầu đã được kiểm tra trước. Xây dựng thử nghiệm quanh hai hoặc ba angles already proven in the wild và bạn đang thử nghiệm các biến thể trên một người thắng thay vì các dự đoán lạnh lùng; bạn có thể duyệt các sáng tạo đối thủ đang hoạt động miễn phí với native ad research tool. Ít biến thể, chất lượng cao hơn đồng nghĩa với mẫu nhỏ hơn, thời gian thử nghiệm ngắn hơn, và ít ngân sách bị tiêu hao cho việc khám phá.
Một ví dụ thực tế, từ đầu đến cuối#
Giả sử bạn chạy một đề nghị lead-gen trả $60 với một chiến dịch tạo khoảng 1,500 click mỗi ngày trên các ô thử nghiệm của mình.
- Giai đoạn sáng tạo: bốn sáng tạo cạnh tranh ở mức CTR. Một vài nghìn lượt hiển thị mỗi cái giải quyết trong 2–3 ngày; cắt giảm xuống hai sáng tạo hàng đầu.
- Giai đoạn landing: hai landing page ở mức chuyển đổi. CVR cơ sở khoảng 3%, phát hiện tăng 30% tương đối (0.9 điểm tuyệt đối): n ≈ 16 × 0.03 × 0.97 ÷ 0.009² ≈ 5,700 clicks per variant, khoảng 11,400 tổng cộng. Với 1,500 click mỗi ngày, đó là tám ngày — gọi là một tuần đầy đủ cộng thêm cuối tuần.
- Kết luận: một chu kỳ thử nghiệm chạy 10–12 ngày từ khi khởi động đến khi có người thắng đáng tin cậy, với chi tiêu thua lỗ bị giới hạn bởi quy tắc guardrail thay vì để chạy dựa trên hy vọng.
Đó là hình dạng thực tế của "thời gian": vài ngày triage rẻ, hơn một tuần đo lường tập trung, và độ dài lịch được quyết định bởi khối lượng click của bạn — không phải bởi con số ma thuật của bất kỳ ai.







