دوره Databricks برای مبتدیان: تحلیل داده - مسیر حرفهای
✅ سرفصل و جزئیات آموزش
آنچه یاد خواهید گرفت:
- ساخت پایپ لاین های Delta Lake سرتاسری (Bronze → Silver → Gold) در Databricks و ذخیرهسازی جداول Delta مدیریتشده در Unity Catalog
- پیادهسازی ETL قدرتمند با PySpark: تبدیل نوع ایمن، مدیریت duplicate، اعمال اجباری اسکیما و تبدیلهای مقیاسپذیر
- بهینهسازی jobهای Spark با استفاده از پارتیشنبندی، کشینگ، استراتژیهای join و عیبیابی با Spark UI برای کاهش زمان اجرا و هزینه
- ایجاد تحلیلهای آماده تولید: SQL پیشرفته (CTEs، توابع پنجره، MERGE) و views کسب و کار قابل استفاده مجدد
- تولید مصورسازیها و گزارشهای شفاف از داده Spark با استفاده از ابزارهای داخلی Databricks و کتابخانههای Python (Matplotlib/Seaborn)
- ساخت پایپ لاین های اولیه Structured Streaming با مقصدهای Delta Lake و مدیریت رویدادهای دیررس/duplicate با نشانگذاری آبی و deduplication
- اعمال یک گردش کار مقدماتی یادگیری ماشین (ML): آمادهسازی ویژگیها، آموزش/ارزیابی مدل، ردیابی با MLflow و ذخیرهسازی مدل
پیشنیازهای دوره
- آشنایی اولیه با برنامهنویسی (راحتی در خواندن و ویرایش کد Python)
- دانش اولیه SQL (SELECT ،JOIN ،GROUP BY)
- یک لپتاپ/رایانه رومیزی با دسترسی به اینترنت
- یک حساب Databricks (نسخه Community یا آزمایشی) - دستورالعملها در بخش 2 ارائه شده است
- توصیه میشود اما ضروری نیست: تجربه پایه با pandas یا Jupyter notebook برای شروع سریعتر
- هیچ تجربه قبلی با Spark یا Databricks لازم نیست - این دوره با راهاندازی workspace شروع میشود و شما را گامبهگام راهنمایی میکند.
توضیحات دوره
دوره عملی Databricks + Delta Lake: ETL با PySpark، پایپ لاین های مدالیون، مصورسازی، پردازش استریمینگ و یادگیری ماشین اولیه
این دوره مسیر حرفه ای برای آموزش مهارتهای عملی و آماده بازار کار در Databricks طراحی شده است و بهطور ویژه برای مهندسان داده و متخصصان تحلیل داده مناسب است. شما از مبانی راهاندازی workspace و دریافت داده شروع میکنید و بهتدریج پایپ لاین های داده تکرارپذیر Bronze به Silver به Gold را با استفاده از فناوری Delta Lake میسازید. در طول دوره، پاکسازی قدرتمند داده و تبدیلهای پیچیده را با PySpark انجام میدهید و از الگوهای پیشرفته SQL برای پشتیبانی از تحلیلهای جامع استفاده میکنید. این برنامه درسی تأکید زیادی بر روشهای مهندسی دفاعی دارد؛ از جمله تبدیل نوع ایمن، مدیریت مؤثر duplicates، اعمال اسکیما و پیادهسازی استراتژیهای آزمون کامل تا اطمینان حاصل شود که پایپ لاین ها داده شما در محیطهای تولید بهصورت قابل اعتماد و پایدار اجرا میشوند.
علاوه بر این، یاد خواهید گرفت چگونه گردشکارهای تبدیل را بهصورت کارآمد طراحی و اجرا کنید، Databricks Jobs را برای خودکارسازی زمانبندی کنید و با استفاده از تکنیکهایی مانند پارتیشنبندی، کشینگ و تحلیل Spark UI، عملکرد Spark را بهینه کنید. این دوره همچنین شامل بخشهایی در مورد مصورسازی و گزارشسازی است و نشان میدهد چگونه خروجیهای پاکسازیشده Spark را با ابزارهای مصورسازی داخلی Databricks و همچنین کتابخانههای محبوب Python مانند Matplotlib و Seaborn به نمودارهای قانعکننده و بینشمحور تبدیل کنید. علاوه بر این، Pro Track مفاهیم اولیه پردازش structured streaming، از جمله عملیات stateful را پوشش میدهد و یک گردش کار مقدماتی یادگیری ماشین را با استفاده از MLlib و MLflow برای ردیابی و مدیریت آزمایشها معرفی میکند.
آزمایشگاههای عملی، مطالعههای موردی واقعی بر پایه مجموعه داده مانند Netflix و IMDb، و دفترچههای قابل دانلود، فرصت کافی برای تمرین کل فرآیند سرتاسری فراهم میکنند. این فرآیند شامل دریافت داده خام، پاکسازی و اعتبارسنجی آن، ساخت جداول Delta، ایجاد پایپ لاین های داده، مصورسازی بینشها و استقرار jobهای پایه است. تا پایان دوره، قادر خواهید بود پایپ لاین های داده درجه تولید را پیادهسازی کنید، jobهای Spark را برای عملکرد بهتر بهینه کنید و تحلیلهای قابل اعتماد و عملی را به ذینفعان ارائه دهید.
موضوعات مرتبط را بررسی کنید.
الزامات Databricks
- ناوبری عمیق در workspace
- خوشهها در مقابل انبارهای SQL
- دفترچهها: Python در مقابل SQL در مقابل Scala
اصول Spark
- RDDها در مقابل DataFrames در مقابل Datasets
- تبدیلها و اقدامات
- مدل اجرای Spark (jobs ،stages ،tasks)
مهندسی داده در Databricks
- دریافت داده (فایلها، پایگاههای داده، APIs)
- بارهای افزایشی و زمانبندی با Jobs
- مبانی Delta Lake (جداول ACID، سفر در زمان)
تحلیل SQL در Databricks
- Joins، توابع پنجره، تجمیعها
- ساخت داشبورد در Databricks SQL
- مبانی بهینهسازی کوئری
مفاهیم Delta Lake و Lakehouse
- معماری Bronze / Silver / Gold
- تکامل و اعمال اجباری اسکیما
- CDC و پردازش استریمینگ با Delta
کیفیت داده و مشاهدهپذیری
- بررسی null/duplicate در مقیاس بزرگ
- انتظارات (به عنوان مثال با کتابخانههایی مانند Great Expectations)
- نظارت پایپ لاین های داده
یادگیری ماشین (ML) و تحلیل پیشرفته
- استفاده از MLflow در Databricks
- مهندسی ویژگی در دفترچهها
- نمونههای اولیه خوشهبندی/رگرسیون
هزینه و حاکمیت
- اندازهگذاری خوشه و کنترل هزینه
- کنترل دسترسی، مجوزهای جدول
- مبانی حسابرسی/لاگ کردن
این دوره برای چه کسانی مناسب است؟
- مهندسان داده سطح junior تا mid-level و مهندسان تحلیل که باید پایپ لاین های ETL قابل اعتماد و گردشکارهای تولید Delta Lake بسازند.
- تحلیلگران داده و مهندسان BI که میخواهند تحلیلها را از دفترچهها به پایپ لاین های قابل تکرار مقیاس دهند و گزارشهای مصور قابل اشتراک تولید کنند.
- مهندسان نرمافزار یا مهندسان بکاند که به سمت مهندسی داده حرکت میکنند، Python/SQL اولیه میدانند و به تجربه عملی Spark/Databricks نیاز دارند.
- سرپرستان تیم یا مشارکتکنندگان فنی که باید کیفیت داده را اعتبارسنجی کنند، jobهای Spark را بهینه کنند یا گردشکارهای ساده پردازش استریمینگ/یادگیری ماشین را پیادهسازی کنند.
دوره Databricks برای مبتدیان: تحلیل داده - مسیر حرفهای
-
مقدمه دوره - این درس را تماشا کنید 02:34
-
درباره مدرس شما 02:30
-
Databricks چیست؟ 07:08
-
مقدمهای بر نسخه رایگان (Community) Databricks برای تحلیل داده یکپارچه 01:24
-
مروری بر سیستم فایل Databricks (DBFS) و قابلیتهای آن 01:06
-
آزمون اصول Databricks: درسهای 01 تا 03 None
-
شروع کار با Databricks Workspace در نسخه رایگان 11:47
-
ناوبری در Databricks Workspace: نوارهای ناوبری بالا و سمت چپ 10:20
-
ناوبری در Databricks Workspace: نوار کناری سمت راست 08:01
-
اولین Databricks Notebook شما با کد Python: راهنمای گامبهگام (درس) 01:40
-
تکلیف عملی: Hello World و ریاضیات ساده برای تست محیط None
-
تکلیف عملی: راهنمای گامبهگام کد پایتون «Hello World» 04:58
-
اعتبارسنجی منطق Python با یک تکلیف ساده ریاضی در Databricks 02:31
-
مروری بر گردش کار چرخه عمر داده Databricks (DDLW) 03:23
-
گردش کار چرخه عمر داده Databricks (DDLW) None
-
درک ذخیرهسازی داده در Databricks: از DBFS تا Volumes 06:40
-
ذخیرهسازی داده و Volumeهای Unity Catalog None
-
آمادهسازی داده نمونه برای بارگذاری (عملی) 06:04
-
آمادهسازی داده نمونه برای بارگذاری None
-
ایجاد یک Volume در Unity Catalog 04:30
-
ایجاد یک Volume در Unity Catalog None
-
بارگذاری فایلها در ولوم Unity Catalog خود (عملی) 04:44
-
بارگذاری فایلها در ولوم Unity Catalog خود (عملی) None
-
تأیید و دسترسی به فایلها در یک Volume (عملی) 10:37
-
تأیید و دسترسی به فایلها در یک Volume (عملی) None
-
مدیریت فایلها و پوشهها در Volumeها (عملی) 08:59
-
مدیریت فایلها و پوشهها در Volumeهای Unity Catalog None
-
اعمال داده Volume: اولین تحلیل شما (انتقال به تکلیف) 05:49
-
اعمال داده Volume: اولین تحلیل شما None
-
مدیریت و بررسی عملی داده با Volumeها در Databricks (PDHEV) None
-
PDHEV - یک بخش حیاتی از کد آغازین 07:24
-
PDHEV - راهحل بازبینی داده (Q1-Q3): Count ،Select ،Filter در PySpark 07:23
-
PDHEV - راهحل تبدیل داده و مدیریت فایل (Q4 - Q7) 14:24
-
تکلیف عملی: مدیریت و بررسی عملی داده با Unity None
-
درک گردش کار چرخه عمر داده Databricks (DDLW) 13:39
-
واژگان اصلی یک مهندس داده (تحلیل داده) که با Spark کار میکند 05:55
-
مجموعهداده مشخص: ارزیابی آدرس Kaggle 02:39
-
چگونگی دانلود مجموعهداده از Kaggle و ایجاد حساب جدید 03:10
-
دریافت داده و مبانی Unity Catalog برای انجام EDA: تحلیل اکتشافی داده 06:16
-
خواندن داده از Unity Catalog 05:17
-
بازبینی و پاکسازی داده 06:36
-
توضیح کد بازبینی و پاکسازی داده 01 - COALESCE در عمل، قبل و بعد 01:50
-
توضیح کد بازبینی و پاکسازی داده 02 - بررسی مقادیر null در یک ستون 05:47
-
توضیح کد بازبینی و پاکسازی داده 03 - تبدیل نوع یک ستون به IntegerType 05:54
-
پروفایلینگ سریع داده: اطمینان از کیفیت داده پیش از سوالات Netflix و مصورسازی 02:36
-
محدودیتهای پروفایلینگ داده و راهحلهای جایگزین در نسخه رایگان Databricks 12:06
-
تحلیل اکتشافی (سوالات «Netflix») 12:03
-
آزمایشگاه عملی برای مصورسازی و ذخیره بینش: دریافت داده (لایه Bronze) 05:13
-
آزمایشگاه عملی برای مصورسازی و ذخیره بینش: پاکسازی و پالایش (آمادهسازی Silver) 04:56
-
آزمایشگاه عملی برای مصورسازی و ذخیره بینش: مصورسازی بینشها با SQL و Python 08:41
-
آزمایشگاه عملی برای مصورسازی و ذخیره بینش: ماندگار کردن جدول لایه Silver 04:20
-
تکلیف عملی: تحلیل تبدیل Silver None
-
تکلیف عملی: تحلیل تبدیل Silver (پاسخ) 09:21
-
نکته) آزمایشگاه عملی برای مصورسازی و ذخیره نتایج: تغییر دائمی داده 06:35
-
دریافت و خواندن داده (درسهای 01 و 02) None
-
بازبینی و پاکسازی داده (مجموعه درس 3) None
-
EDA و مصورسازی (درسهای 04 و 05) None
-
مدیریت پیشرفته و عیبیابی (L05-1، تبدیل Silver، خطاها) None
مشخصات آموزش
دوره Databricks برای مبتدیان: تحلیل داده - مسیر حرفهای
- تاریخ به روز رسانی: 1405/04/02
- سطح دوره:مقدماتی
- تعداد درس:58
- مدت زمان :04:39:43
- حجم :6.23GB
- زبان:دوبله زبان فارسی
- دوره آموزشی:AI Academy