كيفية تحليل نتائج اختبار A/B بدون إحصائي (دليل 2026)

لتحليل نتائج اختبار A/B، قارن بين المجموعتين بناءً على مقياس رئيسي واحد. تحقق مما إذا كانت الفجوة أكبر من التباين العشوائي الطبيعي، ثم حدد النطاق الذي يمكن أن يقع فيه الفرق الحقيقي. يمكن لبرنامج Excel إجراء العمليات الحسابية، لكن القرارات التقديرية المحيطة بها هي ما يفسد الأمر عادةً.
يغطي هذا الدليل ما يجب جمعه قبل النظر إلى الأرقام وكيفية إجراء الاختبار يدويًا. كما يوضح أيضًا حدود الطريقة اليدوية، وكيفية قراءة النتائج بموضوعية وأمانة.
ما تحتاجه قبل أن تتمكن من قراءة نتائج الاختبار على الإطلاق
هناك أربعة أمور تحدد ما إذا كانت النتيجة تعني شيئًا أم لا. اجمعها أولاً.
مقياس رئيسي واحد، يتم اختياره قبل تشغيل الاختبار. مثل معدل التحويل، أو الإيرادات لكل زائر، أو معدل التنشيط. حدده مسبقًا؛ فاختياره بعد رؤية البيانات هو الطريقة التي تقنع بها الفرق نفسها بتحقيق فوز وهمي.
الأعداد الخام، وليس فقط النسب المئوية. فزيادة بنسبة 3% تعني شيئًا معينًا عندما يكون عدد الزوار 200، وتعني شيئًا مختلفًا تمامًا عندما يكون العدد 200,000. أنت بحاجة إلى القواسم (المقامات).
النافذة الزمنية الكاملة للاختبار. الأسابيع غير المكتملة تشوه النتائج، لأن سلوك المستخدمين في أيام العمل يختلف عنه في عطلة نهاية الأسبوع. قم بتشغيل الاختبار لأسابيع كاملة.
سجل بما تم تغييره. متغير واحد فقط لكل اختبار. إذا قمت بتغيير العنوان الرئيسي ولون الزر معًا، فلن تتمكن أي عملية إحصائية من الفصل بين تأثيرهما.
إذا كان أي من هذه الأمور الأربعة مفقودًا، فتوقف قبل البدء في الحسابات. فالحسابات الدقيقة لاختبار معيب ستؤدي حتمًا إلى إجابة خاطئة تبدو موثوقة.
السؤالان اللذان يجيب عنهما كل اختبار A/B
تتلخص كل نتيجة في سؤالين، ومن السهل الخلط بينهما.
هل الفرق حقيقي؟ هذا هو سؤال الدلالة الإحصائية. وهو يتساءل عن مدى احتمالية ظهور فجوة بهذا الحجم إذا كان أداء النسختين متطابقًا بالفعل. وتجيب قيمة p-value عن هذا السؤال. والمتعارف عليه هو أن أي قيمة أقل من 0.05 تعد غير محتملة بدرجة كافية لاتخاذ إجراء بناءً عليها.
هل الفرق كبير بما يكفي ليكون مؤثرًا؟ هذا هو سؤال حجم التأثير. ويجيب عنه هامش الثقة، من خلال تحديد النطاق الذي يرجح أن يقع فيه الفرق الحقيقي. فالزيادة الحقيقية إحصائيًا بنسبة 0.2% قد لا تستحق تكلفة التطوير الهندسي.
إن اعتبار الاختبار ذي الدلالة الإحصائية ولكن بتأثير ضئيل بمثابة نجاح هو خطأ شائع ومكلف في التفسير. أجب عن كلا السؤالين بهذا الترتيب. واذكر الرقمين معًا، لأن الفريق الذي لا يسمع سوى قيمة p-value سيتعامل مع كل نتيجة ذات دلالة إحصائية على أنها جاهزة للإطلاق.
الطريقة اليدوية في Excel
يتعامل Excel مع هذا الأمر بشكل مدمج. وتعتمد الطريقة على نوع المقياس الذي تختبره.
ضع المجموعتين جنبًا إلى جنب
خصص عمودًا واحدًا لكل إصدار. بالنسبة للمقاييس المستمرة مثل الإيرادات لكل زائر، يمثل كل صف قيمة زائر واحد. أما بالنسبة للتحويل، فيكون كل صف إما 1 أو 0. احتفظ بالصفوف الخام بدلاً من الملخص، لأن الصيغ الحسابية تحتاج إلى التوزيع الأساسي للبيانات.
استخدم T.TEST للمقاييس المستمرة
ترجع الدالة T.TEST(array1, array2, tails, type) الاحتمالية المرتبطة باختبار t لـ Student. استخدم tails = 2 ما لم تكن قد قررت مسبقًا أن اتجاهًا واحدًا فقط هو المهم. بالنسبة لـ type، استخدم 1 للعينات المترابطة، و 2 عندما يكون للمجموعتين تباين متساوٍ، و 3 عندما لا يكون كذلك. ويعد اختبار العينتين بتباين غير متساوٍ هو الخيار الافتراضي الأكثر أمانًا لمعظم اختبارات الويب.
ترجع هذه الصيغة قيمة p-value مباشرة. توثق صفحة دالة T.TEST من Microsoft هذه الوسائط.
تعامل مع معدلات التحويل بشكل مختلف
التحويل هو نسبة مئوية وليس مقياسًا مستمرًا. النهج القياسي هو اختبار z لنسبتين، ولا يحتوي Excel على دالة واحدة مخصصة لذلك. لديك خياران قابلان للتطبيق.
قم ببناء اختبار z يدويًا من النسبة المجمعة والخطأ المعياري، ثم قم بتحويل النتيجة إلى قيمة p-value باستخدام NORM.S.DIST. أو ضع الأعداد في جدول ثنائي (2×2) للمحولين وغير المحولين حسب كل إصدار. احسب الأعداد المتوقعة، ثم استخدم CHISQ.TEST للحصول على قيمة p-value.
كلا الخيارين يعملان، لكن كلاهما يتطلب إعادة البناء في كل مرة يتغير فيها هيكل الاختبار.
حدود الطريقة اليدوية
هناك ثلاثة أشياء تؤدي دائمًا إلى فشل هذه الطريقة.
لا تخبرك قيمة p-value وحدها بحجم الزيادة، لذا لا تزال بحاجة إلى حساب منفصل لهامش الثقة. كما أن المقاييس المتعددة تضاعف معدل الإيجابيات الكاذبة، ولا يوجد شيء في ورقة العمل يحذرك من ذلك. بالإضافة إلى أن كل اختبار جديد يعني إعادة بناء نفس الصيغ لبيانات مصدرة ذات تنسيق مختلف.
هناك تكلفة رابعة يسهل التغاضي عنها؛ فالشخص الذي قام ببناء ورقة العمل يصبح هو الوحيد القادر على مراجعتها وتدقيقها.
بالنسبة لاختبار واحد، تعد الطريقة اليدوية جيدة. أما بالنسبة لبرنامج اختبار أسبوعي، فستجد نفسك تعيد بناء نفس ورقة العمل خمسين مرة في السنة.
كيفية تحليل نتائج اختبار A/B باستخدام Powerdrill Bloom
إذا كانت بيانات الاختبار الخاصة بك موجودة بالفعل في ملف مصدر، فيمكنك تخطي خطوة تركيب الصيغ الحسابية.
الخطوة 1: تحميل بيانات الاختبار الخاصة بك
قم بسحب وإفلات ملف التصدير بصيغة Excel أو CSV أو TSV من أداة الاختبار أو قاعدة البيانات الخاصة بك. يمكن تحميل ملفات متعددة معًا، بحيث يمكن مقارنة ملف الأحداث وملف المستخدمين في خطوة واحدة. يتم تشغيل ميزة اكتشاف الأعمدة وتنظيفها تلقائيًا عند التحميل.
الخطوة 2: وصف المقارنة بلغة طبيعية
اطرح السؤال بالطريقة التي تطرحها بها على زميلك. على سبيل المثال: "قارن التحويل بين الإصدارين A و B، وأخبرني ما إذا كان الفرق دالاً إحصائيًا، وأعطني هامش الثقة". يختار الوكيل الاختبار المناسب لنوع المقياس، ويعرض قيمة p-value وهامش الثقة، ويشرح الاختبار الذي استخدمه. اطلب تقسيمًا تفصيليًا للشرائح وسيقوم بإعادة التشغيل بدلاً من إجبارك على إعادة البناء.
الخطوة 3: تصدير المخطط البياني أو التقرير أو العرض التقديمي
استخرج النتيجة في شكل مخطط بياني، أو أدرجها في ملخص مكتوب، أو حوّل لوحة العمل إلى شرائح لعرضها. تصدر الأنماط Professional و Business و Fancy جميعها إلى PowerPoint أو Notion. بالنسبة للجانب المرئي، تغطي أداة تصور البيانات أنواع المخططات الأخرى المتاحة من نفس الملف المحمل.
كيفية قراءة المخرجات دون مبالغة في الادعاءات
| ما تراه | ما يعنيه | ما لا يعنيه |
|---|---|---|
| p = 0.03 | فجوة بهذا الحجم غير محتملة في حال عدم وجود فرق حقيقي | لا يعني وجود فرصة بنسبة 97% بأن B هو الأفضل |
| p = 0.20 | لا توجد أدلة كافية للحسم | ليس دليلاً على أن النسخ متطابقة |
| نطاق من −1% إلى +6% | قد تكون الزيادة الحقيقية سلبية | ليست زيادة بنسبة 2.5%، حتى لو كانت هذه هي نقطة المنتصف |
| ذو دلالة إحصائية ولكن بزيادة قدرها 0.2% | حقيقي، ولكن على الأرجح لا يستحق الإطلاق | ليس نجاحًا تجاريًا في حد ذاته |
| ذو دلالة إحصائية في مقياس واحد من أصل ثمانية | هو تقريبًا ما تنتجه الصدفة وحدها | ليس اكتشافًا |
قرب الأرقام بأمانة أيضًا. فذكر الزيادة برقمين عشريين يوحي بدقة لا يدعمها حجم العينة.
اكتب الاستنتاج في جملة تتضمن نطاقًا. فقولك "أدى الإصدار B إلى زيادة التحويل بنسبة تتراوح بين 1% و 5%" هو قول صادق وأمين. أما قولك "الإصدار B هو الفائز" فليس دقيقًا، ما لم يكن النطاق بالكامل أعلى من الصفر.
أخطاء شائعة
إيقاف الاختبار بمجرد أن يبدو ذو دلالة إحصائية لأول مرة. إن التحقق المتكرر وإيقاف الاختبار عند أول لحظة جيدة يضخم الإيجابيات الكاذبة بشكل كبير. حدد حجم العينة وتاريخ الانتهاء مسبقًا، ثم انتظر.
اختبار ثمانية مقاييس والإعلان عن المقياس الفائز. مع وجود مقاييس كافية، سيتجاوز أحدها حاجز 0.05 بالصدفة البحتة. حدد المقياس الرئيسي مقدمًا وتعامل مع الباقي كإطار سياقي فقط.
تجاهل القاسم. تنتج العينات الصغيرة تقلبات حادة في النسب المئوية تبدو دراماتيكية. اعرض الأعداد دائمًا بجانب المعدلات.
تقسيم الشرائح بعد فوات الأوان حتى ينجح شيء ما. إن تقسيم البيانات حسب الجهاز والبلد والقناة حتى تظهر شريحة واحدة ذات دلالة إحصائية هو نفس المشكلة ولكن بشكل مختلف. حدد الشرائح التي تهمك مسبقًا.
مقارنة مجموعات لم تكن قابلة للمقارنة من الأساس. إذا تم تقسيم حركة المرور بشكل غير متساوٍ، أو تم تشغيل الإصدارات في أيام مختلفة، فإن الفرق المقاس سيشمل هذا الخلل أيضًا.
التعامل مع النتيجة الصفرية كفشل. إن الاختبار الذي لا يظهر أي فرق يقدم معلومات حقيقية وقيمة؛ فهو يجنبك إطلاق تغيير يتطلب جهدًا دون أي عائد.
باختصار
يتلخص تحليل نتائج اختبار A/B في إجابتين: هل الفرق حقيقي، وهل هو كبير بما يكفي ليكون مؤثرًا. يمنحك Excel الإجابة الأولى باستخدام T.TEST ويجبرك على تركيب الصيغ للثانية. وتتطلب النسب اختبارًا مختلفًا عن المقاييس المستمرة، وهي الخطوة التي يتخطاها معظم الناس.
إذا كنت تجري اختبارات بانتظام، فإن عملية إعادة البناء هي الجزء الذي يستحق التخلص منه. جرب Powerdrill Bloom مجانًا — قم بتحميل ملف التصدير، واطلب المقارنة بلغة طبيعية، ثم قم بتصدير التقرير. للاطلاع على خيارات الأدوات، راجع أدوات الذكاء الاصطناعي لتحليل اختبار A/B، وللتعرف على الأساسيات، راجع كيفية تشغيل الإحصاء الوصفي.
الأسئلة الشائعة
كيفعرف ما إذا كانت نتائج اختبار A/B الخاص بي ذات دلالة إحصائية؟
قارن بين المجموعتين بناءً على مقياسك الرئيسي واحسب قيمة p-value. تعد القيمة الأقل من 0.05 هي الحد المعتاد لاعتبار الفرق غير ناتج عن الصدفة. اربط ذلك بهامش الثقة، لأن الدلالة الإحصائية وحدها لا تخبرك بأي شيء عن مدى كبر الفرق.
هل يمكنني تحليل نتائج اختبار A/B في Excel؟
نعم. استخدم T.TEST للمقاييس المستمرة مثل الإيرادات لكل زائر. معدلات التحويل هي نسب مئوية، لذا فهي تتطلب اختبار z لنسبتين أو اختبار مربع كاي على جدول أعداد ثنائي (2×2). لا يحتوي Excel على دالة مدمجة واحدة لاختبار النسبتين.
ما هو حجم العينة الذي أحتاجه لاختبار A/B؟
يعتمد ذلك على معدلك الأساسي وأصغر زيادة تستحق الكشف عنها. تتطلب الزيادات المتوقعة الأصغر حجم عينات أكبر بكثير. احسب الحجم المستهدف قبل الإطلاق، ثم استمر في تشغيل الاختبار حتى الوصول إلى هذا الرقم بدلاً من التوقف عندما تبدو النتيجة جيدة.
ماذا تخبرني قيمة p-value فعليًا؟
إنها تعطي احتمالية رؤية فرق بهذا الحجم على الأقل إذا كان أداء النسختين متطابقًا بالفعل. تعني قيمة p-value المنخفضة أن الصدفة تفسير غير مرجح. وهي لا تعني احتمالية أن يكون إصدارك هو الأفضل.
لماذا لم يظهر اختبار A/B الخاص بي أي فرق؟
هناك ثلاثة أسباب شائعة: إما أن العينة كانت أصغر من أن تكشف عن التأثير، أو أن التغيير كان طفيفًا جدًا بحيث لم يؤثر على السلوك، أو أنه لا يوجد فرق بالفعل. النتيجة الصفرية هي نتيجة حقيقية في حد ذاتها، وهي تحميك من إطلاق شيء لا يحقق أي عائد.