مهندسی داده

دوره‌ی پایتون مقیاس‌پذیر برای مهندسی داده

Scaling Python for Data Engineering

پردازش داده‌های بزرگ‌تر از حافظه فقط با پایتون: اندازه‌گیری و کاهش مصرف حافظه با انتخاب نوع داده، بارگذاری فقط داده‌ی موردنیاز، پردازش تکه‌تکه، موازی‌سازی و ساخت ساختمان‌های داده‌ای که جریان‌های واقعی به آن‌ها متکی‌اند؛ همه روی داده‌های واقعی تاکسی‌های نیویورک. این دوره برای تیم‌های سازمانی، به‌صورت حضوری یا آنلاین و به زبان فارسی برگزار می‌شود.

سطح
مقدماتی تا متوسط
مدت دوره
۲ روز (۱۶ ساعت)
درس در ۸ بخش
۳۶
شیوه‌ی برگزاری
حضوری یا آنلاین

آنچه شرکت‌کنندگان می‌آموزند

  • اندازه‌گیری هزینه‌ی واقعی داده در حافظه و کاهش آن با انتخاب نوع داده‌ی مناسب
  • بارگذاری فقط داده‌ی موردنیاز و پردازش تکه‌تکه‌ی داده‌های بزرگ‌تر از حافظه
  • استفاده از NumPy و pandas در مقیاسی که کد ساده دیگر جواب نمی‌دهد
  • موازی‌سازی پردازش روی چند هسته‌ی پردازنده
  • انتخاب ساختمان‌های داده‌ای که جریان‌های واقعی بر پایه‌ی آن‌ها ساخته می‌شوند

کار عملی: یک جریان پردازش برای داده‌های بزرگ‌تر از حافظه روی داده‌های تاکسی نیویورک

سرفصل دوره

۸ بخش و ۳۶ درس، در ۲ روز آموزشی (۱۶ ساعت، هر روز ۸ ساعت). سرفصل، مدت و تمرین‌ها متناسب با سطح و نیاز تیم شما تنظیم می‌شود.

  1. ۱

    وقتی داده از حافظه بزرگ‌تر می‌شود

    ۵ درس
    • دیوار حافظه
    • سنجش مصرف حافظه و انواع داده
    • جعبه‌ابزار مهندس داده
    • بارگذاری فقط داده‌ی موردنیاز
    • پروژه‌ی راهنمادار: بررسی داده‌های تاکسی نیویورک
  2. ۲

    NumPy برای مهندسی داده

    ۵ درس
    • چرا NumPy
    • نوع داده، دقت و حافظه
    • برداری‌سازی: از حلقه تا عملیات آرایه‌ای
    • انتشار (Broadcasting)
    • پروژه‌ی راهنمادار: شاخص‌های سفر با NumPy
  3. ۳

    pandas در مقیاس بزرگ

    ۵ درس
    • کاهش اندازه‌ی نوع داده‌های عددی
    • داده‌های دسته‌ای (Categorical)
    • عملیات کارآمد و پرهیز از کپی‌های اضافه
    • گروه‌بندی و تجمیع سریع
    • پروژه‌ی راهنمادار: بارگذار کم‌مصرف داده‌های تاکسی
  4. ۴

    پردازش تکه‌تکه و فراتر از حافظه

    ۵ درس
    • ایده‌ی تکه‌بندی داده
    • تجمیع جریانی
    • SQLite به‌عنوان انبار داده‌ی محلی
    • جریان‌های پردازش افزایشی و قابل ازسرگیری
    • پروژه‌ی راهنمادار: تجمیع داده‌ی چندماهه‌ای که در حافظه جا نمی‌شود
  5. ۵

    پردازش موازی

    ۵ درس
    • چرا موازی‌سازی (و قفل سراسری مفسر)
    • multiprocessing و Process Pool
    • الگوی MapReduce
    • پردازش موازی تکه‌های داده
    • پروژه‌ی راهنمادار: تجمیع موازی همراه با اندازه‌گیری
  6. ۶

    ساختمان‌های داده برای کار با داده

    ۵ درس
    • دیکشنری و مجموعه: جست‌وجوی O(1) و حذف تکراری‌ها
    • پشته و صف
    • هیپ و صف اولویت
    • انتخاب ساختار مناسب
    • پروژه‌ی راهنمادار: ایندکس درون‌حافظه‌ای و Top-N
  7. ۷

    بازگشت و درخت

    ۵ درس
    • بازگشت برای پردازش داده
    • درخت جست‌وجوی دودویی
    • درخت برای مرتب‌سازی و ادغام
    • ایندکس‌گذاری یک فایل
    • پروژه‌ی راهنمادار: ایندکس بازه‌ی زمانی روی داده‌های تاکسی
  8. ۸

    پروژه‌ی پایانی

    ۱ درس
    • پروژه‌ی پایانی: جریان تحلیلی برای داده‌های بزرگ‌تر از حافظه

شیوه‌های برگزاری

حضوری در محل سازمان

برگزاری کلاس در سازمان شما، با تمرین روی ابزارها و نمونه‌هایی نزدیک به کار روزانه‌ی تیم. زمان و مکان با هماهنگی تعیین می‌شود.

آنلاین و زنده

کلاس‌های تعاملی آنلاین با پرسش و پاسخ، تمرین گروهی و بازخورد مستقیم؛ مناسب تیم‌هایی که در چند شهر یا دورکار هستند.

کارگاه کوتاه یا دوره‌ی جامع

از کارگاه یک‌روزه برای یک موضوع مشخص تا دوره‌ی چندماهه برای آماده‌کردن تیم در یک مسیر شغلی کامل.

دوره‌های مرتبط

همه‌ی دوره‌ها

برگزاری دوره‌ی پایتون مقیاس‌پذیر برای مهندسی داده در سازمان شما

تعداد شرکت‌کنندگان، سطح تیم و زمان مدنظر را بفرستید تا برای نیازسنجی و هماهنگی برنامه‌ی دوره با شما تماس گرفته شود.