كيفية العثور على القيم المتطرفة في مجموعة بيانات دون كتابة كود (دليل 2026)

يمكنك العثور على القيم الشاذة دون كتابة تعليمات برمجية باستخدام قاعدة IQR، أو درجات z-scores، أو المخطط الصندوقي — وتعمل هذه الطرق الثلاث جميعها في جداول البيانات. تحدد قاعدة IQR القيم التي تبعد أكثر من 1.5 من المدى الربيعي عن الربيعيات؛ بينما تحدد درجات z-scores القيم التي تبعد أكثر من ثلاثة انحرافات معيارية عن المتوسط. وغالبًا ما تختلف الطريقتان، ومعرفة سبب ذلك هي المهارة الحقيقية.
إن العثور على القيمة الشاذة هو النصف السهل من المهمة. أما اتخاذ القرار بشأن ما يجب فعله بها فهو النصف الذي يحدد مدى نزاهة تحليلك، ولا توجد طريقة تجيبك على ذلك نيابة عنك.
يوضح هذا الدليل سبب اختلاف الطريقتين القياسيتين وثلاث طرق للكشف عن القيم الشاذة دون الحاجة إلى تعليمات برمجية. ثم يتناول كيفية اتخاذ القرار بشأن ما إذا كان ينبغي إزالة قيمة معينة، أو الاحتفاظ بها، أو الإبلاغ عنها بشكل منفصل.
لماذا تعد القيم الشاذة أصعب من مجرد "حذفها"
الطريقتان القياسيتان تختلفان بطبيعتهما وتصميمهما
تعتمد قاعدة IQR على الربيعيات، وهي قيم موضعية. فهي لا تهتم بمدى تطرف القيمة، بل بموقعها في الترتيب المصنف فقط. وهذا يجعلها مقاومة للتشوه بفعل القيم الشاذة نفسها التي تبحث عنها.
تعتمد درجات z-scores على المتوسط والانحراف المعياري، وكلاهما يتأثر بالقيم المتطرفة. فقيمة واحدة ضخمة كفيلة بتضخيم الانحراف المعياري، مما يقلل من قيمة كل درجة z-score — بما في ذلك درجتها هي نفسها. وفي مجموعات البيانات الصغيرة، يمكن لقيمة شاذة واحدة كبيرة أن تخفي نفسها بهذه الطريقة.
لهذا السبب يمكن أن يظهر في العمود نفسه أربع قيم شاذة بموجب قاعدة IQR وقيمة واحدة فقط بموجب درجات z-scores. الطرق ليست متناقضة، بل تقيس أشياء مختلفة.
القرار ليس إحصائيًا بحتًا
إن إجراء معاملة بقيمة 2 مليون دولار في ملف يحتوي على طلبات بقيمة 200 دولار سيتم تمييزه بواسطة كل الطرق. ولكن تحديد ما إذا كان ينبغي إزالتها يعتمد على حقائق لا تملك أي طريقة إحصائية القدرة على الوصول إليها.
إذا كان الأمر يتعلق بخطأ في إدخال البيانات بسبب وضع علامة عشرية في مكان خاطئ، فقم بإزالتها. وإذا كانت صفقة حقيقية لشركة كبرى، فإن إزالتها تعني حذف أهم عملائك من التحليل. أما إذا كانت معاملة تجريبية نسي أحدهم مسحها، فقم بإزالتها وابحث عن معاملات أخرى مشابهة. ثلاثة إجراءات مختلفة، لعلامة تحذيرية واحدة متطابقة.
شكل التوزيع يكسر الفرضيات
تفترض كلتا الطريقتين القياسيتين توزيعًا يشبه الجرس تقريبًا. لكن الدخل، ومشاهدات الصفحات، وقيم الطلبات، ومدة الجلسات عادة ما تكون ملتوية ولها ذيل طويل جهة اليمين، حيث تكون القيم المرتفعة طبيعية وليست استثنائية.
إذا قمت بتطبيق قاعدة z-score على هذا النوع من الأعمدة، فسينتهي بك الأمر إلى تمييز جزء كبير من البيانات العادية تمامًا كقيم شاذة. والحل هو التحقق من شكل التوزيع أولاً، والتفكير في استخدام التحويل اللوغاريتمي أو استخدام حد فاصل يعتمد على المئينات بدلاً من ذلك.
ما الذي يكلفك إياه هذا الأمر
متوسطات لا تصف أحدًا. يمكن لقيمة متطرفة واحدة أن تحرك المتوسط بدرجة كافية تجعله يقع خارج النطاق الذي توجد فيه معظم بياناتك بالفعل. ومع ذلك، تُتخذ القرارات بناءً على هذا الرقم.
مخططات بيانية بمحاور غير مقروءة. قيمة واحدة أكبر بعشر مرات من بقية القيم تضغط كل شيء آخر في خط مسطح بالقرب من القاع. يكون المخطط صحيحًا من الناحية الفنية ولكنه لا يوصل أي معلومة مفيدة.
الحذف الصامت. أسوأ نتيجة هي أن يقوم شخص ما بحذف الصفوف غير الملائمة بهدوء قبل مشاركة الملف. لا أحد من مستخدمي البيانات اللاحقين سيعرف أن الأساس قد تغير، ولا يمكن إعادة إنتاج النتيجة.
ثلاث طرق للعثور على القيم الشاذة دون كتابة تعليمات برمجية
الخيار 1: قاعدة IQR
استخدم QUARTILE للحصول على الربيعين الأول والثالث، ثم اطرحهما للحصول على المدى الربيعي. قم بتمييز أي قيمة تقل عن Q1 مطروحًا منه 1.5 × IQR أو تزيد عن Q3 مضافًا إليه 1.5 × IQR.
هذا هو الخيار الافتراضي لسبب وجيه: فهو مقاوم للقيم المتطرفة ولا يتطلب أي افتراضات حول شكل التوزيع. ومع ذلك، في البيانات الملتوية بشدة، فإنه لا يزال يفرط في تمييز القيم في الذيل الأيمن، لذا تحقق من شكل التوزيع قبل الوثوق بالعدد الإجمالي.
الخيار 2: درجات Z-scores
احسب المتوسط والانحراف المعياري باستخدام STDEV.P، ثم احسب عدد الانحرافات المعيارية التي تبعدها كل قيمة عن المتوسط. وعادة ما يكون الحد المعتمد هو ما يتجاوز ثلاثة انحرافات معيارية.
تعمل هذه الطريقة بشكل جيد مع البيانات المتماثلة تقريبًا وتمنحك حجمًا أو مقدارًا بدلاً من مجرد علامة نعم أو لا، وهو أمر مفيد للترتيب. ومع ذلك، فهي غير موثوقة في العينات الصغيرة والأعمدة الملتوية.
الخيار 3: المخطط الصندوقي
ارسم العمود كمخطط صندوقي واقرأ النقاط التي تقع خارج الخطوط الطرفية. يستخدم المخطط الصندوقي في Excel نفس قاعدة 1.5 × IQR، لذا تتطابق النتيجة مع الخيار 1. والفرق هو أنك ترى شكل التوزيع في الوقت نفسه.
هذه هي أسرع طريقة للتحقق مما إذا كانت الطريقتان الأخريان مناسبتين من الأساس. إذا كان الصندوق ملتصقًا بشدة بأحد الطرفين مع وجود ذيل طويل، فتعامل مع أي قاعدة حدية بحذر وشك.
أين تصطدم الطرق الثلاث بنفس السقف
ترجع كل طريقة قائمة بالصفوف المميزة. ولكن لا تخبرك أي منها بأي من هذه العلامات يمثل أخطاءً، وأيها يمثل قيمًا متطرفة حقيقية، وأيها يعني ببساطة أن العمود ملتوٍ وليس مليئًا بالأخطاء.
تتطلب الإجابة عن ذلك النظر إلى الصفوف المميزة في سياقها؛ ما الذي يحتويه هذا الصف أيضًا، وهل تتجمع هذه القيم في فترة زمنية واحدة أو نظام مصدر واحد، وهل يظهر العميل نفسه بشكل متكرر. هذا هو التحقيق وليس الحساب، وهو المكان الذي يضيع فيه الوقت الفعلي.
كيفية العثور على القيم الشاذة باستخدام Powerdrill Bloom
الخطوة 1: تحميل بياناتك
قم بتحميل ملف Excel أو CSV. يقوم Powerdrill Bloom بتحليل خصائص كل عمود فور وصوله، بحيث يظهر شكل التوزيع والقيم المتطرفة قبل أن تختار طريقة الكشف.
الخطوة 2: وصف عملية الفحص بلغة طبيعية
اسأل مباشرة: حدد القيم التي تقع خارج نطاق 1.5 من المدى الربيعي في هذا العمود، ثم اعرض لي الصفوف الكاملة حتى أتمكن من رؤية السياق. وتابع بالأسئلة التي تحسم القرار فعليًا: هل تتجمع الصفوف المميزة حسب التاريخ أو المصدر، وهل يتكرر المعرّف نفسه، وكيف تتغير الإحصاءات الملخصة إذا تم استبعادها.
الخطوة 3: تصدير المخطط أو التقرير أو العرض التقديمي
استخرج المخطط الصندوقي، أو جدولاً بالصفوف المميزة مع سياقها، أو ملاحظة مكتوبة تسجل الصفوف التي تم استبعادها وسبب ذلك.
لماذا يتفوق هذا الأسلوب على الفحص اليدوي للكشف عن القيم الشاذة
| طريقة جداول البيانات | Powerdrill Bloom | |
|---|---|---|
| مقارنة نتائج IQR وz-score | مجموعتان من الصيغ، ومطابقة يدوية | اطلب كليهما |
| رؤية السياق المحيط بالقيمة المميزة | التصفية والتمرير | تُعرض مع الصف مباشرة |
| التحقق من شكل التوزيع أولاً | إنشاء مخطط تكراري | يتم تحليل الخصائص عند التحميل |
| اختبار تأثير الاستبعاد | نسخ الورقة مكررة | اطلب النسختين معًا |
الصف الأخير هو الأكثر أهمية. فالطريقة النزيهة للتعامل مع قيمة شاذة غامضة هي الإبلاغ عن النتيجة بوجودها وبدونها. دع القارئ يرى ما إذا كان الاستنتاج يعتمد على صف واحد فقط. هذه المقارنة تتطلب إعادة بناء العمل بالكامل في جداول البيانات، ولهذا السبب لا تحدث عادةً.
أفضل الممارسات: اتخاذ القرار بشأن ما يجب فعله بالقيمة الشاذة
حقّق قبل الاستبعاد. انظر إلى الصف بأكمله. فالفاصلة العشرية الموضوعة في مكان خاطئ، وسجل الاختبار، والعميل الحقيقي الكبير، كلها تبدو متطابقة تمامًا في عمود واحد.
لا تحذف بصمت أبدًا. إذا قمت باستبعاد صفوف، فاذكر عددها وسبب ذلك في نفس مستند النتيجة. فالتحليل الذي يتغير أساسه دون ملاحظة توضيحية لا يمكن إعادة إنتاجه.
أبلغ عن كلا الإصدارين عندما يكون الأمر مهمًا. إذا تغير الاستنتاج تمامًا بناءً على قيمة واحدة، فهذا هو الاكتشاف الفعلي في حد ذاته، وليس مجرد إزعاج يجب التخلص منه وتجميله.
تحقق من شكل التوزيع قبل اختيار الحد الفاصل. تحتاج الأعمدة الملتوية إلى حدود مئينية أو تحويل لوغاريتمي، وليس إلى قاعدة z-score.
انتبه للتجمعات. عادةً ما يعني وصول عدة قيم شاذة في نفس التاريخ أو من نفس المصدر وجود مشكلة في تدفق البيانات بدلاً من وجود عملاء غير عاديين بالفعل. يغطي دليلنا حول تنظيف البيانات وإزالة التكرار منها هذه الحالة.
خاتمة
يتلخص العثور على القيم الشاذة دون كتابة تعليمات برمجية في ثلاث أدوات. تعد قاعدة IQR خيارًا افتراضيًا مقاومًا، وتناسب درجات z-scores البيانات المتماثلة تقريبًا عندما تريد معرفة الحجم والمقدار، بينما يتحقق المخطط الصندوقي مما إذا كان أي من الافتراضين صحيحًا. توقع أن تختلف هذه الأدوات، وتَعامَل مع هذا الاختلاف كمعلومات قيمة.
الجزء الذي لا تغطيه أي طريقة هو اتخاذ القرار. إذا كان عملك على القيم الشاذة يتوقف عند مجرد تمييز العمود لأن التحقيق في كل صف يستغرق وقتًا طويلاً، فجرّب Powerdrill Bloom على الملف. راجع أيضًا صفحة تنظيف البيانات بالذكاء الاصطناعي، ودليلنا حول تشغيل الإحصاء الوصفي، وتحويل ملف CSV إلى مخطط بياني.
الأسئلة الشائعة
ما الذي يُعتبر قيمة شاذة في مجموعة البيانات؟
جرى العرف على أنها القيمة التي تبعد أكثر من 1.5 من المدى الربيعي عن الربيع الأول أو الثالث، أو أكثر من ثلاثة انحرافات معيارية عن المتوسط. وكلاهما يمثلان أعرافًا متبعة وليست قوانين صارمة، ويعتمد الخيار الأنسب منهما على ما إذا كانت بياناتك متماثلة تقريبًا أو ملتوية.
كيف يمكنني العثور على القيم الشاذة في Excel دون كتابة تعليمات برمجية؟
استخدم دالة QUARTILE لإنشاء حدود IQR وتمييز القيم الخارجة عنها، أو احسب درجات z-scores باستخدام المتوسط ودالة STDEV.P. ويمنحك المخطط الصندوقي نفس نتيجة IQR بصريًا ويعرض شكل التوزيع في الوقت نفسه.
هل يجب علي إزالة القيم الشاذة من تحليلي؟
فقط بعد تحديد سبب وجودها. يجب إزالة أخطاء إدخال البيانات وسجلات الاختبار؛ أما القيم المتطرفة الحقيقية فلا ينبغي إزالتها عادةً، لأن حذفها يعني حذف معلومات حقيقية وهامة. وعندما يكون الأمر غامضًا، أبلغ عن النتيجة بكلتا الطريقتين.
لماذا تحدد طريقتا IQR وz-score قيمًا مختلفة؟
تعتمد طريقة IQR على الربيعيات، والتي لا يمكن للقيم المتطرفة تشويهها. بينما تعتمد درجات z-scores على المتوسط والانحراف المعياري، واللذين يتشوهان بفعل القيم المتطرفة. فالقيمة الكبيرة بما يكفي تضخم الانحراف المعياري ويمكن أن تخفي نفسها.
ماذا لو كانت بياناتي ملتوية وليست على شكل جرس؟
تفرط الحدود القياسية في تمييز القيم في الذيل الطويل للأعمدة الملتوية مثل الدخل أو قيمة الطلب. استخدم حدودًا تعتمد على المئينات، أو قم بتحويل العمود لوغاريتميًا أولاً، وتحقق من شكل التوزيع قبل اختيار أي قاعدة.