مهندسی داده

دوره‌ی پردازش کلان‌داده با PySpark

PySpark for Data Engineering

یادگیری عملی Apache Spark روی رایانه‌ی شخصی: منطق Spark در Driver، Executor و طرح‌های اجرای Lazy؛ DataFrame و Spark SQL روی ده میلیون سفر واقعی تاکسی؛ طرح اجرا، پارتیشن، Shuffle و کش؛ و یک جریان ETL در قالب محیط عملیاتی با Schema، کنترل کیفیت و ثبت رویداد. این دوره برای تیم‌های سازمانی، به‌صورت حضوری یا آنلاین و به زبان فارسی برگزار می‌شود.

سطح
متوسط
مدت دوره
۲ روز (۱۶ ساعت)
درس در ۸ بخش
۳۶
شیوه‌ی برگزاری
حضوری یا آنلاین

آنچه شرکت‌کنندگان می‌آموزند

  • توضیح نقش واقعی Driver، Executor و طرح اجرای Lazy
  • کار با DataFrame و Spark SQL روی ده میلیون رکورد واقعی
  • خواندن طرح اجرا و کنترل پارتیشن‌ها، Shuffle و کش
  • ساخت جریان ETL در قالب محیط عملیاتی با کنترل کیفیت و ثبت رویداد

کار عملی: جریان کامل ETL با Spark روی داده‌های واقعی تاکسی نیویورک

سرفصل دوره

۸ بخش و ۳۶ درس، در ۲ روز آموزشی (۱۶ ساعت، هر روز ۸ ساعت). سرفصل، مدت و تمرین‌ها متناسب با سطح و نیاز تیم شما تنظیم می‌شود.

  1. ۱

    چرا پردازش توزیع‌شده؟

    ۵ درس
    • سقف توان یک رایانه
    • Driver، Executor و حالت محلی
    • اولین SparkSession
    • Spark چه زمانی برتری دارد (و چه زمانی نه)
    • پروژه‌ی راهنمادار: داده‌ی یک فصل در Spark
  2. ۲

    SparkSession، RDD و ارزیابی Lazy

    ۵ درس
    • تبدیل‌ها در برابر اقدام‌ها
    • RDD در لایه‌های زیرین
    • گراف DAG: Job، Stage و Task
    • تغییرناپذیری و تبارنامه‌ی داده
    • پروژه‌ی راهنمادار: ردگیری کامل یک Job
  3. ۳

    DataFrame و تبدیل‌ها

    ۵ درس
    • ستون‌ها و عبارت‌ها
    • فیلتر و پاک‌سازی
    • Join
    • گروه‌بندی و تجمیع
    • پروژه‌ی راهنمادار: گزارش منطقه–ساعت در Spark
  4. ۴

    Spark SQL و طرح اجرا

    ۵ درس
    • View موقت و SQL
    • خواندن خروجی .explain()
    • بهینه‌سازی‌های Catalyst
    • توابع تعریف‌شده‌ی کاربر و هزینه‌ی آن‌ها
    • پروژه‌ی راهنمادار: بهینه‌سازی یک کوئری کند
  5. ۵

    پارتیشن، Shuffle و کش

    ۵ درس
    • پارتیشن‌ها
    • تبدیل‌های باریک و پهن: Shuffle
    • کش و ماندگاری
    • عدم توازن داده و کارهای عقب‌مانده
    • پروژه‌ی راهنمادار: بهینه‌سازی Job منطقه–ساعت
  6. ۶

    ساخت جریان ETL در Spark

    ۵ درس
    • Schemaها
    • خواندن ← پاک‌سازی ← تبدیل
    • نوشتن نتایج
    • Jobهای تکرارپذیر بدون اثر جانبی
    • پروژه‌ی راهنمادار: ETL فصلی
  7. ۷

    کیفیت داده و ثبت رویداد

    ۵ درس
    • قواعد اعتبارسنجی
    • الگوهای قرنطینه‌ی داده
    • ثبت ساختاریافته‌ی رویدادها
    • شکست آشکار و به‌موقع
    • پروژه‌ی راهنمادار: اجرای ETL همراه با کنترل کیفیت
  8. ۸

    پروژه‌ی پایانی

    ۱ درس
    • پروژه‌ی پایانی: جریان Spark عملیاتی شرکت CityFlow

شیوه‌های برگزاری

حضوری در محل سازمان

برگزاری کلاس در سازمان شما، با تمرین روی ابزارها و نمونه‌هایی نزدیک به کار روزانه‌ی تیم. زمان و مکان با هماهنگی تعیین می‌شود.

آنلاین و زنده

کلاس‌های تعاملی آنلاین با پرسش و پاسخ، تمرین گروهی و بازخورد مستقیم؛ مناسب تیم‌هایی که در چند شهر یا دورکار هستند.

کارگاه کوتاه یا دوره‌ی جامع

از کارگاه یک‌روزه برای یک موضوع مشخص تا دوره‌ی چندماهه برای آماده‌کردن تیم در یک مسیر شغلی کامل.

دوره‌های مرتبط

همه‌ی دوره‌ها

برگزاری دوره‌ی پردازش کلان‌داده با PySpark در سازمان شما

تعداد شرکت‌کنندگان، سطح تیم و زمان مدنظر را بفرستید تا برای نیازسنجی و هماهنگی برنامه‌ی دوره با شما تماس گرفته شود.