دورهی پایتون مقیاسپذیر برای مهندسی داده
Scaling Python for Data Engineering
پردازش دادههای بزرگتر از حافظه فقط با پایتون: اندازهگیری و کاهش مصرف حافظه با انتخاب نوع داده، بارگذاری فقط دادهی موردنیاز، پردازش تکهتکه، موازیسازی و ساخت ساختمانهای دادهای که جریانهای واقعی به آنها متکیاند؛ همه روی دادههای واقعی تاکسیهای نیویورک. این دوره برای تیمهای سازمانی، بهصورت حضوری یا آنلاین و به زبان فارسی برگزار میشود.
- سطح
- مقدماتی تا متوسط
- مدت دوره
- ۲ روز (۱۶ ساعت)
- درس در ۸ بخش
- ۳۶
- شیوهی برگزاری
- حضوری یا آنلاین
آنچه شرکتکنندگان میآموزند
- اندازهگیری هزینهی واقعی داده در حافظه و کاهش آن با انتخاب نوع دادهی مناسب
- بارگذاری فقط دادهی موردنیاز و پردازش تکهتکهی دادههای بزرگتر از حافظه
- استفاده از NumPy و pandas در مقیاسی که کد ساده دیگر جواب نمیدهد
- موازیسازی پردازش روی چند هستهی پردازنده
- انتخاب ساختمانهای دادهای که جریانهای واقعی بر پایهی آنها ساخته میشوند
کار عملی: یک جریان پردازش برای دادههای بزرگتر از حافظه روی دادههای تاکسی نیویورک
سرفصل دوره
۸ بخش و ۳۶ درس، در ۲ روز آموزشی (۱۶ ساعت، هر روز ۸ ساعت). سرفصل، مدت و تمرینها متناسب با سطح و نیاز تیم شما تنظیم میشود.
- ۱
وقتی داده از حافظه بزرگتر میشود
۵ درس- دیوار حافظه
- سنجش مصرف حافظه و انواع داده
- جعبهابزار مهندس داده
- بارگذاری فقط دادهی موردنیاز
- پروژهی راهنمادار: بررسی دادههای تاکسی نیویورک
- ۲
NumPy برای مهندسی داده
۵ درس- چرا NumPy
- نوع داده، دقت و حافظه
- برداریسازی: از حلقه تا عملیات آرایهای
- انتشار (Broadcasting)
- پروژهی راهنمادار: شاخصهای سفر با NumPy
- ۳
pandas در مقیاس بزرگ
۵ درس- کاهش اندازهی نوع دادههای عددی
- دادههای دستهای (Categorical)
- عملیات کارآمد و پرهیز از کپیهای اضافه
- گروهبندی و تجمیع سریع
- پروژهی راهنمادار: بارگذار کممصرف دادههای تاکسی
- ۴
پردازش تکهتکه و فراتر از حافظه
۵ درس- ایدهی تکهبندی داده
- تجمیع جریانی
- SQLite بهعنوان انبار دادهی محلی
- جریانهای پردازش افزایشی و قابل ازسرگیری
- پروژهی راهنمادار: تجمیع دادهی چندماههای که در حافظه جا نمیشود
- ۵
پردازش موازی
۵ درس- چرا موازیسازی (و قفل سراسری مفسر)
- multiprocessing و Process Pool
- الگوی MapReduce
- پردازش موازی تکههای داده
- پروژهی راهنمادار: تجمیع موازی همراه با اندازهگیری
- ۶
ساختمانهای داده برای کار با داده
۵ درس- دیکشنری و مجموعه: جستوجوی O(1) و حذف تکراریها
- پشته و صف
- هیپ و صف اولویت
- انتخاب ساختار مناسب
- پروژهی راهنمادار: ایندکس درونحافظهای و Top-N
- ۷
بازگشت و درخت
۵ درس- بازگشت برای پردازش داده
- درخت جستوجوی دودویی
- درخت برای مرتبسازی و ادغام
- ایندکسگذاری یک فایل
- پروژهی راهنمادار: ایندکس بازهی زمانی روی دادههای تاکسی
- ۸
پروژهی پایانی
۱ درس- پروژهی پایانی: جریان تحلیلی برای دادههای بزرگتر از حافظه
شیوههای برگزاری
حضوری در محل سازمان
برگزاری کلاس در سازمان شما، با تمرین روی ابزارها و نمونههایی نزدیک به کار روزانهی تیم. زمان و مکان با هماهنگی تعیین میشود.
آنلاین و زنده
کلاسهای تعاملی آنلاین با پرسش و پاسخ، تمرین گروهی و بازخورد مستقیم؛ مناسب تیمهایی که در چند شهر یا دورکار هستند.
کارگاه کوتاه یا دورهی جامع
از کارگاه یکروزه برای یک موضوع مشخص تا دورهی چندماهه برای آمادهکردن تیم در یک مسیر شغلی کامل.
دورههای مرتبط
همهی دورههابرگزاری دورهی پایتون مقیاسپذیر برای مهندسی داده در سازمان شما
تعداد شرکتکنندگان، سطح تیم و زمان مدنظر را بفرستید تا برای نیازسنجی و هماهنگی برنامهی دوره با شما تماس گرفته شود.