
دليل SPSS: تقنيات متقدمة لتنظيف البيانات
أتقن معالجة البيانات في SPSS والتعامل مع القيم المفقودة وإعداد مجموعات البيانات لتحليل صارم، مع لقطات شاشة خطوة بخطوة.
لماذا يهم تنظيف البيانات؟
يمكن القول إن تنظيف البيانات هو أهم خطوة في أي تحليل. فالبيانات التي لم تُنظَّف جيدًا تؤدي إلى نتائج متحيزة واستنتاجات خاطئة وجهد ضائع. وفي SPSS يشمل تنظيف البيانات تحديد القيم المفقودة ومعالجتها، واكتشاف القيم المتطرفة، وفحص التناقضات، والتحقق من أنواع المتغيرات، والتأكد من أن مجموعة البيانات جاهزة للتحليل. وتشير استطلاعات أُجريت على العاملين في مجال البيانات إلى أن إعداد البيانات يستهلك حصة كبيرة من وقت التحليل، بنحو 45 في المئة في المتوسط بحسب أحد استطلاعات عام 2020 (Anaconda, 2020).
تحديد القيم المفقودة في SPSS
يستخدم SPSS نوعين من القيم المفقودة: المفقودة بحكم النظام (system-missing، وتظهر على شكل نقاط في Data View عندما لا تُدخَل أي قيمة)، والقيم المفقودة التي يحددها المستخدم (user-defined missing، وهي رموز تعيّنها للدلالة على أنواع محددة من عدم الاستجابة، مثل 99 لعبارة «رفض الإجابة»). ولتقدير مدى البيانات المفقودة، شغّل Analyze → Descriptive Statistics → Frequencies وافحص أعداد القيم المفقودة لكل متغير. ولتحليل أنماط الفقد بتفصيل أكبر، استخدم Analyze → Missing Value Analysis.
التعامل مع البيانات المفقودة
يتوقف النهج الذي تختاره على آلية الفقد. فإذا كان من المرجّح أن البيانات مفقودة عشوائيًا تمامًا (Missing Completely at Random، MCAR) وكانت نسبة الفقد صغيرة (قاعدة تقريبية شائعة هي نحو 5% أو أقل)، فإن الحذف على مستوى الحالات (listwise deletion) مقبول عمومًا، مع أن خطر التحيز يزداد كلما ارتفعت نسبة البيانات المفقودة. أما في حالة الفقد العشوائي (Missing at Random، MAR) فيوصى بالإسناد المتعدد (multiple imputation)، ويوفره SPSS ضمن Transform → Multiple Imputation. ويُنصح عمومًا بعدم استخدام الاستعاضة بالمتوسط لأنها تقلل التباين بصورة مصطنعة وقد تشوّه العلاقات بين المتغيرات. والمعيار الذهبي هو الإسناد المتعدد، إذ يُنشئ عدة مجموعات بيانات مكتملة، ويحلل كلًّا منها، ثم يجمع النتائج.
اكتشاف القيم المتطرفة وإدارتها
يمكن أن تشوّه القيم المتطرفة المتوسطات والانحرافات المعيارية ومعاملات الانحدار. في SPSS استخدم Analyze → Descriptive Statistics → Explore لإنشاء مخططات الصندوق (boxplots) وتحديد القيم القصوى. ويمكنك أيضًا حساب الدرجات المعيارية z (Analyze → Descriptive Statistics → Descriptives → Save standardized values)؛ وتُعدّ القيم التي تتجاوز نحو ±3.29 (أي ما يقارب p < .001 بذيلين) قيمًا متطرفة محتملة في العادة. وقبل حذف أي قيمة متطرفة، تحقق مما إذا كانت تمثل خطأً حقيقيًا في إدخال البيانات أم ملاحظة حقيقية وإن كانت غير معتادة. وغالبًا ما تكون المعالجة بطريقة وينسور (Winsorizing)، أي استبدال القيم القصوى بأقرب قيمة غير قصوى، أفضل من الحذف.
إعادة ترميز المتغيرات وتحويلها
يوفر SPSS أدوات قوية لتحويل البيانات. استخدم Transform → Recode into Different Variables لإنشاء فئات جديدة (مثل تجميع الأعمار في شرائح). واستخدم Transform → Compute Variable للعمليات الحسابية مثل إنشاء الدرجات المجمّعة أو المتوسطات المركّبة. أعد الترميز دائمًا إلى متغير جديد بدلًا من الكتابة فوق المتغير الأصلي؛ فهذا يحفظ بياناتك الخام ويجعل إجراءاتك قابلة لإعادة الإنتاج.
فحص جودة البيانات قبل التحليل
قبل تشغيل أي اختبار إحصائي، أجرِ هذه الفحوص: تحقق من أنواع المتغيرات (اسمي، رتبي، مقياس) في Variable View؛ وشغّل جداول التكرارات لاكتشاف القيم المستحيلة؛ وابحث عن الحالات المكررة باستخدام Data → Identify Duplicate Cases؛ وقيّم الاعتدالية باختبار Shapiro-Wilk أو بمخططات Q-Q. وسيجنّبك الالتزام بقائمة منهجية لتنظيف البيانات اكتشاف المشكلات بعد أن تكون قد أجريت تحليلاتك بالفعل.
المراجع
Anaconda. (2020). 2020 state of data science. https://www.anaconda.com/resources/whitepaper/state-of-data-science-2020