ساخت پایپ لاین ETL با PySpark
✅ سرفصل و جزئیات آموزش
آنچه یاد خواهید گرفت
مجموعههای داده بزرگ را با ابزارهای سنتی ETL میتوان بهصورت کند، ناکارآمد و مقیاسپذیری دشوار در دسترس قرار داد. PySpark فریمورک محاسبات توزیعشده قدرتمندی ارائه میدهد که بهصورت کارآمد دادههای بزرگ را پردازش میکند، اما شروع کار ممکن است بدون راهنمایی مناسب چالشبرانگیز باشد.
در این دوره، ساخت پایپ لاین ETL با PySpark، توانایی طراحی و پیادهسازی گردش های کاری مقیاسپذیر ETL را با استفاده از PySpark کسب خواهید کرد.
ابتدا، روش استخراج داده از منابع متعدد، از جمله فرمتهای ساختاریافته و بدون ساختار مانند CSV ،JSON و Parquet را بررسی خواهید کرد.
سپس میآموزید چگونه داده را با استفاده از عملیات قدرتمند DataFrame در PySpark، شامل فیلتر کردن، تجمیع و مدیریت مقادیر گمشده، تبدیل و پاکسازی کنید.
در نهایت، یاد می گیرید چگونه با بهینهسازی عملکرد از طریق پارتیشن بندی، bucketing و بروزرسانیهای افزایشی، دادههای پردازششده را بهصورت کارآمد در مقصدهای مختلف بارگذاری کنید.
با پایان این دوره، مهارتها و دانش PySpark ETL را به دست می آورید که برای ساخت پایپ لاین داده مقیاسپذیر و با عملکرد بالا در اپلیکیشن های واقعی نیاز است.
ساخت پایپ لاین ETL با PySpark
-
PySpark در مقابل پانداس و ETL مبتنی بر SQL 1m 59s
-
اجرای اولین نوت بوک PySpark 5m 56s
-
خواندن داده ساختاریافته و بدون ساختار 6m 32s
-
اتصال به پایگاههای داده و فضای ذخیرهسازی ابری 4m 19s
-
استراتژیهای استخراج داده کارآمد: استخراج دستهای در مقابل استخراج افزایشی 5m 5s
-
تکنیکهای پاکسازی داده در PySpark 7m 26s
-
تبدیل داده با جوین ها و تجمیعها 4m 18s
-
استفاده از توابع تعریفشده توسط کاربر در PySpark 3m 11s
-
تکنیکهای بهینهسازی برای PySpark ETL 5m 6s
-
نوشتن داده در مقصدهای مختلف 5m 47s
-
پیادهسازی بروزرسانیهای افزایشی 6m 10s
-
زمانبندی جاب های ETL 2m 39s
-
ساخت پایپ لاین مقاوم 3m 48s
-
ETL بلادرنگ و مانیتورینگ 4m 46s
مشخصات آموزش
ساخت پایپ لاین ETL با PySpark
- تاریخ به روز رسانی: 1404/12/10
- سطح دوره:متوسط
- تعداد درس:14
- مدت زمان :01:07:07
- حجم :393.0MB
- زبان:دوبله زبان فارسی
- دوره آموزشی:AI Academy