تنظيف البيانات باستخدام PySpark: التعامل مع مجموعات البيانات الكبيرة وغير المنظمة — WalkSelf
3.7 (3) ⏱ 2 ساعة 30 دقيقة 📚 25 دورة 🎧 النسخة الصوتية

تنظيف البيانات باستخدام PySpark: التعامل مع مجموعات البيانات الكبيرة وغير المنظمة

حوّل البيانات الخام والفوضوية إلى مجموعات بيانات نظيفة وجاهزة للإنتاج باستخدام Python و Apache Spark، وقم بتوسيع نطاق مسارات عملك من النماذج الأولية المحلية إلى بيئات الإنتاج الضخمة.

  • 💬 مدرب ذكاء اصطناعي
    اسأل عن أي درس واحصل على إجابة واضحة فورًا، في أي وقت.
  • 🕐 ابدأ في أي وقت
    بلا جداول أو مواعيد نهائية — تعلّم بوتيرتك، وقتما يناسبك.
  • 🌐 بالعربية
    الدروس والمهام والشهادة — كل ذلك بلغتك بالكامل.

حول هذه الدورة

يمكن أن يؤدي الانتقال من نماذج البيانات المحلية النظيفة إلى مجموعات البيانات الفوضوية على نطاق الإنتاج التي تحتوي على ملايين الصفوف إلى تعطيل مسارات البيانات التقليدية بسرعة. يرشدك هذا المساق النصي خلال عملية تنظيف البيانات الكبيرة وتنظيمها وتحسينها باستخدام Python و Apache Spark. ستنتقل من كتابة البرامج النصية الأساسية إلى بناء مسارات PySpark قوية وجاهزة للإنتاج. ستتقن التقنيات المطلوبة للتعامل مع القيم المفقودة، وتصحيح التنسيقات غير المتناسقة، وتحليل الهياكل المتداخلة المعقدة، وتحسين مهام معالجة البيانات لديك من أجل السرعة والموثوقية. ما ستتعلمه: - فهم البنية الأساسية لـ Spark وكيفية إدارة PySpark لعمليات تنظيف البيانات الموزعة. - تنظيف وتطبيع مجموعات البيانات الفوضوية عن طريق التعامل مع القيم المفقودة والتكرارات وأنواع البيانات غير الصحيحة. - تحليل وإعادة هيكلة تنسيقات البيانات المعقدة، بما في ذلك JSON المتداخل والمصفوفات، إلى مخططات جدولية نظيفة. - تحسين أداء المسار باستخدام التخزين المؤقت (caching) والبث (broadcasting) وتنسيقات الملفات الفعالة مثل Parquet و Delta Lake. - التحقق من جودة البيانات على نطاق واسع باستخدام تقنيات فرض المخطط الحديثة وتسجيل الأخطاء. - تطبيق تلميحات النوع (type hints) ومبادئ التصميم المعياري لكتابة كود PySpark قابل للصيانة وجاهز للإنتاج. يبدأ المساق بمفاهيم Spark الأساسية وعمليات DataFrame قبل الانتقال إلى معالجة البيانات المتقدمة، وضبط الأداء، وتصميم مسارات العمل في العالم الحقيقي. ستتعلم من خلال الشروحات المكتوبة الواضحة، وأمثلة الكود المنظمة، والتمارين النصية العملية. تم تصميم هذا المساق لمحللي البيانات، ومهندسي البيانات الطموحين، ومطوري Python الذين يرغبون في توسيع نطاق مهاراتهم في تنظيف البيانات للتعامل مع مجموعات البيانات الضخمة. لا يلزم وجود خبرة سابقة في Spark، على الرغم من أن الفهم الأساسي لـ Python مفيد. ابدأ في بناء مسارات بيانات موثوقة وعالية الأداء اليوم.

ما الذي ستحصل عليه

  • 📜 شهادة إتمام
    أضفها إلى ملفك على LinkedIn
  • 💬 مدرّس AI شخصي
    عالق في دورة؟ اسأل مدرّسك المدمج أي شيء، في أي وقت.
  • 🎧 النسخة الصوتية مضمَّنة
    تعلَّم أثناء تنقُّلك — دون شاشة
  • ♾️ وصول مدى الحياة
    عُد متى شئت، بلا انتهاء
  • 📱 الهاتف أو الكمبيوتر
    يعمل في أي مكان وعلى أي جهاز
  • 💸 استرداد خلال 14 يومًا
    دون أسئلة
  • قصير ومركَّز
    2 ساعة 30 دقيقة من المحتوى التطبيقي

المراجعات (3)

Lensa Kebede ET متعلِّم موثَّق
★ 4 · 09.07.2026

The content is good, but the pace might be a bit fast for absolute beginners. I found myself rewinding quite a bit. Still valuable info.

Andrzej Zieliński PL متعلِّم موثَّق
★ 3 · 25.05.2026

محتوى جيد هنا. في حين أن بعض الوحدات التدريبية كان يمكن أن تكون أكثر تفصيلا، فإن القيمة الإجمالية وقابلية التطبيق عالية. عمل جيد!

Dereje Fantahun ET متعلِّم موثَّق
★ 4 · 25.05.2026

انه دورة متينة, البنية منطقية ومعظم الامثلة كانت مفيدة, يمكن استخدام بعض السيناريوهات من العالم الحقيقي

اكتب مراجعة

سنطلب منك تسجيل الدخول بعد الإرسال — تُحفظ مسودتك.

المتعلمون أخذوا أيضًا

الأسئلة الشائعة

ما الذي أحتاجه لأخذ هذه الدورة؟ +

يكفي هاتف أو كمبيوتر متصل بالإنترنت. بدون تثبيتات أو أجهزة خاصة.

كيف يمكنني الدفع؟ +

بالبطاقة عبر Stripe. لا نخزن بيانات البطاقة — يتولى Stripe ذلك بأمان.

هل يمكنني استرداد المال؟ +

نعم — استرداد كامل خلال 14 يومًا، دون أسئلة.

إلى متى يستمر وصولي؟ +

إلى الأبد. بمجرد الشراء، الدورة لك تعود إليها متى شئت.

هل سأحصل على شهادة؟ +

نعم. عند الإتمام ستحصل على شهادة يمكنك إضافتها إلى ملفك في LinkedIn.

مصمَّم للعاملين في
التقنية التصميم المالية التسويق الرعاية الصحية التعليم الضيافة التصنيع