OpenAdLibraryOpenAdLibrary
الإبداع الإعلاني وسلوكيات التحويل

كم من الوقت يجب أن تستمر اختبارات A/B للإعلانات: الرياضيات العملية لحجم العينة

مدة اختبار A/B هي مسألة حسابية، وليست خرافة: العينة المطلوبة مقسومة على الحجم اليومي. إليك رياضيات حجم العينة بشكل عملي، بالإضافة إلى الحدود الدنيا والعليا وقواعد الإيقاف التي تجعل الاختبارات ميسورة التكلفة.

رسم توضيحي تحريري: كم من الوقت يجب أن تستمر اختبارات A/B للإعلانات: الرياضيات العملية لحجم العينة

شغل اختبار A/B للإعلان حتى يجمع كل متغير عددًا كافيًا من التحويلات لجعل الفرق الذي يهمك مرئيًا — وليس لعدد ثابت من الأيام. كقاعدة عملية، هذا يعني أسبوعًا كاملاً على الأقل لتغطية دورات أيام الأسبوع، وبين 50 إلى بضعة آلاف من التحويلات لكل متغير اعتمادًا على مدى صغر الفرق الذي تريد اكتشافه. المدة هي نتيجة حسابية، وليست تفضيلًا تقويميًا: الأيام اللازمة = العينة المطلوبة لكل متغير ÷ حجمك اليومي لكل متغير. تقدم لك هذه المقالة تلك الحسابات، والحدود الدنيا والعليا التي تتجاوزها، وتسلسل الاختبار الأرخص للاستخدام عندما تقول الرياضيات إنك لا تستطيع تحمل تكلفة الدلالة الإحصائية.

المدة هي نتيجة، وليست خيارًا تقويميًا#

تقدم معظم النصائح إجابة ثابتة — سبعة أيام، أربعة عشر يومًا، شهر. الأيام هي الوحدة الخاطئة. حملة تولد 40 تحويلًا يوميًا تحل اختبار صفحة مقصودة في حوالي أسبوع؛ نفس الاختبار على حملة تولد 4 تحويلات يوميًا يستغرق أكثر من شهرين، وعندها تكون النتيجة ملوثة بكل ما تغير في هذه الأثناء. ثلاثة مدخلات تحدد مدتك الحقيقية:

  • المعدل الأساسي للمقياس الذي تختبره — CTR للإبداعات، معدل التحويل للصفحات المقصودة والعروض.
  • أصغر فرق يستحق الاكتشاف. اكتشاف تحسن بنسبة 10٪ يكلف حركة مرور أكثر بكثير من اكتشاف تحسن بنسبة 50٪، ومعظم التحسينات الصغيرة لا تستحق الإنفاق المطلوب لرؤيتها.
  • الحجم اليومي لكل متغير — تحدده ميزانيتك وعروض السعر.

حدد الأولين وستنتج العينة المطلوبة من صيغة. اقسم على الثالث وستحصل على مدتك. إذا كانت الإجابة أطول من حوالي أربعة أسابيع، فإن الخطوة الصحيحة عادةً هي تغيير الاختبار، وليس الاستمرار فيه — المزيد عن ذلك أدناه.

رياضيات حجم العينة، بدون شهادة إحصائية#

الاختصار القياسي لاختبار ذي متغيرين بثقة 95٪ وقوة 80٪:

n لكل متغير ≈ 16 × p × (1 − p) ÷ d²

حيث p هو معدلك الأساسي كرقم عشري و d هو الفرق المطلق الذي تريد اكتشافه. مثالان عمليان:

  • اختبار إبداعي على مستوى CTR. معدل CTR أساسي 0.5٪، اكتشاف تحسن نسبي 20٪ (0.1 نقطة مطلقة): n ≈ 16 × 0.005 × 0.995 ÷ 0.001² ≈ 80,000 انطباع لكل متغير. تقدم أماكن النشر الأصلية انطباعات سريعة ورخيصة، لذا يمكن حل هذا في أيام.
  • اختبار صفحة مقصودة على مستوى التحويل. معدل تحويل أساسي 2٪، اكتشاف تحسن نسبي 25٪ (0.5 نقطة مطلقة): n ≈ 16 × 0.02 × 0.98 ÷ 0.005² ≈ 12,500 نقرة لكل متغير. بسعر نقرة $0.40، هذا اختبار بخمسة أرقام لزوج واحد من الصفحات.
ما تختبره الأساسي التحسن للاكتشاف العينة لكل متغير
CTR (إبداعي) 0.5٪ 20٪ نسبي ~80,000 انطباع
CTR (إبداعي) 0.5٪ 50٪ نسبي ~13,000 انطباع
CVR (صفحة مقصودة) 25٪ نسبي ~12,500 نقرة
CVR (صفحة مقصودة) 50٪ نسبي ~3,100 نقرة
CVR (صفحة عرض) 25٪ نسبي ~4,900 نقرة

يظهر درسان من هذه الجدول. أولاً، التحسينات الصغيرة باهظة الثمن بشكل قاسٍ: تقليل الفرق القابل للاكتشاف إلى النصف يضاعف العينة أربع مرات. ثانيًا، الاختبار على مستوى الانطباع يكلف جزءًا صغيرًا من الاختبار على مستوى النقرة. يجب أن يشكل هذا التباين برنامج الاختبار بأكمله: اختبر الزوايا الإبداعية على مستوى CTR، واختبر مسارات التحويل على مستوى التحويل، ولا تختبر تغييرات بحجم لون الزر على الإطلاق — نادرًا ما تدفع العينة المطلوبة لاكتشافها تكلفتها.

الحد الأدنى: أسبوع كامل، بغض النظر عن الرياضيات#

حتى عندما يوفر الحجم عينتك في يومين، شغل الاختبار لمدة سبعة أيام على الأقل. يتصرف جمهور أيام الأسبوع وعطلة نهاية الأسبوع بشكل مختلف — أشخاص مختلفون، أجهزة مختلفة، نية مختلفة. مزيج الناشرين على الشبكات الأصلية يتناوب خلال الأسبوع مع تحول دورات الأخبار وجداول المحتوى، لذا حركة مرور الثلاثاء ليست حركة مرور السبت. يضيف تأخر التحويل تحيزًا ثانيًا: قد تتحول نقرات متغير يوم الخميس يوم السبت، لذا فإن التوقف المبكر يفضل بشكل منهجي أي متغير حصل على انطباعاته أولاً. الاختبار الذي ينتهي في منتصف الأسبوع قد عيّن شريحة مشوهة من حركة مرورك الحقيقية، وقد يكون 'الفائز' ببساطة هو المتخصص في أيام الأسبوع.

الحد الأعلى: الاختبارات الطويلة تتعفن من الداخل#

بعد ثلاثة إلى أربعة أسابيع، يتوقف اختبار A/B عن كونه تجربة مضبوطة. التعب الإبداعي يضعف كلا المتغيرين — نادرًا ما يكون بنفس السرعة، مما يعكس التصنيفات بهدوء أثناء الاختبار. يدخل المنافسون المزاد ويغادرونه ويغيرون جودة حركة مرورك. ينجرف الموسم تحت المقارنة بأكملها. إذا قالت الصيغة إنك تحتاج إلى ستة أسابيع من حركة المرور، فاقرأ ذلك كحكم: الفرق الذي تصطاده صغير جدًا لاكتشافه بحجمك. اختبر تباينًا أكبر بدلاً من ذلك — خطاف أو زاوية مختلفة، هيكل مسار تحويل مختلف — حيث يكون الفرق القابل للاكتشاف كبيرًا والعينة ميسورة التكلفة.

لا تتلصص — أو على الأقل لا تتصرف بناءً على التلصص#

نمط الفشل الكلاسيكي: تحقق من لوحة التحكم يوميًا وتعلن النصر في اليوم الأول الذي تبدو فيه الأرقام ذات دلالة. النظرات المتكررة على البيانات المتراكمة ترفع الإيجابيات الكاذبة بشكل كبير — مع التلصص اليومي، تنطلق قاعدة التوقف 'لقد وصلت إلى الدلالة في وقت ما' أكثر بكثير من معدل الخطأ المعلن البالغ 5٪. ثم يفسر الانحدار نحو المتوسط معظم شكاوى 'توقف فائزي عن الفوز': المتغير الذي تقدم في اليوم الثاني كان يركب الضوضاء، ويهبط مرة أخرى. الانضباط بسيط: التزم مسبقًا بحجم عينتك، راقب يوميًا فقط لشروط وقف الخسارة — تعطل التتبع، إنفاق جامح، أداء كارثي لمتغير — وقيم الفائز مرة واحدة، في النهاية.

قواعد الإيقاف عندما لا تستطيع تحمل تكلفة الدلالة الإحصائية#

معظم مشتري النشر الأصلي والشركاء التابعين لا يستطيعون تمويل 12,500 نقرة لكل متغير، والتظاهر بخلاف ذلك ينتج صرامة زائفة. البديل الصادق هو التصفية المرحلية — أكثر خشونة من اختبار الدلالة الإحصائية، وممارسة قياسية بين المشترين الذين يختبرون العشرات من الإبداعات شهريًا:

  1. تصفية CTR (الأيام 1–3). أعط كل إبداع بضعة آلاف من الانطباعات، ثم أوقف كل ما هو أقل بوضوح من المجموعة. أنت لا تثبت شيئًا — أنت تقوم بالفرز حتى تتركز الميزانية على الفائزين المحتملين.
  2. حاجز الإنفاق (مستمر). قاعدة ممارسة شائعة: أوقف أي متغير أنفق 2–3× CPA المستهدف بدون أي تحويلات. هذه ليست إحصاءات؛ إنها بقاء.
  3. الدلالة الإحصائية للمتأهلين للنهائيات. بمجرد أن يحمل اثنان أو ثلاثة ناجون معظم الإنفاق، شغل اختبارًا صحيحًا على مستوى التحويل بينهم باستخدام الرياضيات أعلاه. أنت تمول اختبارًا حقيقيًا واحدًا بدلاً من عشرة اختبارات زائفة.

اختصر العينة: ابدأ من إعلانات نجت بالفعل#

كل متغير لا تحتاج إلى اختباره هو مال موفر، وأرخص معلومة عما ينجح هي ما يستمر المنافسون في الدفع لتشغيله. الإعلان الذي شغل لمدة 30+ يومًا قد اجتاز فحص ربحية مالكه كل يوم من تلك الفترة. يسجل فهرس OpenAdLibrary لأكثر من 725,000 إبداع أصلي نشط عبر 49 شبكة (يونيو 2026) تاريخ المشاهدة الأولى والأخيرة لكل إبداع، مما يحول طول عمر الإعلان إلى إشارة قابلة للتصفية بدلاً من الحدس — أطول الإعلانات الأصلية تشغيلاً في مجال عملك هي شبكة انطلاق مختبرة مسبقًا. ابنِ اختبارك حول زاويتين أو ثلاث زوايا مثبتة بالفعل في السوق وستختبر تباينات على فائز بدلاً من تخمينات باردة؛ يمكنك تصفح إبداعات المنافسين النشطة مجانًا باستخدام أداة البحث عن الإعلانات الأصلية. متغيرات أقل وأفضل تعني عينات أصغر، اختبارات أقصر، وميزانية أقل تحترق على الاكتشاف.

مثال عملي، من البداية إلى النهاية#

لنفترض أنك تدير عرضًا لتوليد العملاء المحتملين بعائد $60 بحملة واحدة تقوم بحوالي 1,500 نقرة يوميًا عبر خلايا الاختبار الخاصة بك.

  • المرحلة الإبداعية: أربعة إبداعات تتنافس على مستوى CTR. بضعة آلاف من الانطباعات لكل منها تحل في 2–3 أيام؛ صف إلى أفضل اثنين.
  • مرحلة الصفحة المقصودة: صفحتان مقصودتان على مستوى التحويل. معدل CVR أساسي حوالي 3٪، اكتشاف تحسن نسبي 30٪ (0.9 نقطة مطلقة): n ≈ 16 × 0.03 × 0.97 ÷ 0.009² ≈ 5,700 نقرة لكل متغير، حوالي 11,400 إجماليًا. بـ 1,500 نقرة يوميًا، هذا ثمانية أيام — قل أسبوع كامل بالإضافة إلى تغطية عطلة نهاية الأسبوع.
  • الحكم: دورة اختبار واحدة تستمر 10–12 يومًا من الإطلاق إلى فائز يمكن الدفاع عنه، مع تحديد الإنفاق الخاسر بقاعدة الحاجز بدلاً من تركه يعمل على أمل.

هذا هو الشكل الواقعي لـ 'كم من الوقت': بضعة أيام من الفرز الرخيص، أسبوع أو أكثر من القياس المركز، وطول تقويمي تحدده حجم نقراتك — وليس بأي رقم سحري لأيام أي شخص.

الأسئلة المتكررة

كم عدد التحويلات التي أحتاجها لكل متغير في اختبار A/B للإعلان؟
كقاعدة عملية، 50–100 تحويل لكل متغير تكشف عن فروق كبيرة (نسبية +30٪) بثقة معقولة، بينما قد تتطلب التحسينات الصغيرة بنسبة 10–15٪ آلاف التحويلات. تعطيك الصيغة n ≈ 16 × p(1−p) ÷ d² العدد الدقيق لمعدلك الأساسي والفرق الذي تريد اكتشافه. إذا كان حجمك لا يمكنه الوصول إليه خلال أربعة أسابيع تقريبًا، اختبر تباينًا إبداعيًا أكبر بدلاً من ذلك.
هل 3 أيام كافية لتشغيل اختبار A/B للإعلان؟
لا. حتى عندما يجمع حملة عالية الحجم عينة كبيرة في ثلاثة أيام، تكون قد عينت جزءًا فقط من الدورة الأسبوعية — جمهور أيام الأسبوع وعطلة نهاية الأسبوع يتحولون بشكل مختلف، وتأخر التحويل يعني أن النقرات المبكرة لم تنتهِ من التحويل بعد. شغل الاختبار لمدة سبعة أيام كاملة على الأقل. الاستثناء هو التصفية المبكرة بناءً على CTR، حيث تقوم بفرز الخاسرين الواضحين بدلاً من إعلان فائز ذي دلالة إحصائية.
هل يجب أن اختبر الإعلانات على أساس CTR أم معدل التحويل؟
كليهما، في مراحل مختلفة. تحتاج الاختبارات على مستوى CTR إلى انطباعات فقط، وهي رخيصة وسريعة، لذا استخدمها لتصفية الإبداعات الضعيفة مبكرًا. تقيس اختبارات معدل التحويل ما تُدفع مقابله بالفعل لكنها تحتاج إلى ميزانية أكبر بـ 10–100 مرة، لذا احتفظ بها للمتأهلين للنهائيات ولتغييرات الصفحات المقصودة أو مسارات التحويل. اختبار كل شيء على مستوى التحويل هو كيف تحرق الحسابات الصغيرة ميزانيتها على صرامة لا تستطيع تحمل تكلفتها.
ماذا يحدث إذا أوقفت اختبار A/B بمجرد وصوله إلى الدلالة الإحصائية؟
أنت ترفع معدل الإيجابيات الكاذبة بشكل كبير. التحقق يوميًا والتوقف عند أول قراءة ذات دلالة يعني أن العديد من 'الفائزين' هو مجرد ضوضاء كان من الممكن أن تتراجع مع المزيد من البيانات — مشكلة التلصق الكلاسيكية. التزم مسبقًا بحجم عينة، واستخدم الفحوصات اليومية فقط لشروط وقف الخسارة مثل تعطل التتبع أو الإنفاق الجامح، وقم بالتقييم مرة واحدة عند اكتمال العينة.
لماذا توقف متغير الإعلان الفائز عن الفوز بعد انتهاء الاختبار؟
عادةً بسبب الانحدار نحو المتوسط: تقدم المتغير المبكر احتوى على حظ، وأداؤه على المدى الطويل يقترب من المتوسط. يضاعف التعب الإبداعي هذا — الفائز الجديد يضعف مع رؤية الجمهور له بشكل متكرر. كلاهما أسباب لإعادة اختبار الأبطال بشكل دوري ولتعامل مع نتيجة أي اختبار مفرد كتقدير بهامش خطأ، وليس كحقيقة دائمة.
فريق OpenAdLibrary
كتب بواسطةفريق OpenAdLibrary
استخبارات الإعلانات وأبحاث الإعلانات الأصلية

نحن نبني OpenAdLibrary، المنصة المفتوحة للشفافية الإعلانية. كل يوم، تلتقط أنظمتنا إعلانات أصلية حية عبر Taboola وOutbrain وMGID وRevcontent وTeads وYahoo وMSN، وتحدد المعلن الحقيقي وراء كل إعلان، وتتبع النقرة إلى صفحة الهبوط الخاصة به. تقدم هذه الأدلة خلاصة ما نراه في تلك البيانات حتى تتمكن من البحث في السوق بشكل أسرع.