آموزش Databricks - تسلط به مهندسی داده Spark ETL و Delta Lake
✅ سرفصل و جزئیات آموزش
آنچه یاد خواهید گرفت:
- مرور کلی دوره و مسیر یادگیری
- تجزیه و تحلیل راهنمای آزمون
- Databricks چیست و چرا برای مهندسی داده مهم است؟
- ایجاد و ناوبری در محیط Databricks
- بررسی عمیق رابط کاربری Databricks
- چگونگی عملکرد Databricks به عنوان یک پلتفرم یکپارچه
- مدیریت فایل و نوتبوک در Databricks
- گزینههای محاسباتی Databricks و تنظیمات کلاستر
- محیط نوتبوک Databricks و فرمان های ضروری
- میانبرهای افزایش بهرهوری برای توسعه سریعتر
- مبانی معماری Lakehouse
- درک لایههای مدالیون (برنز، نقره، طلا)
- تراکنشهای ACID و ملزومات لاگ دلتا
- از DBFS تا Unity Catalog
- لایههای Unity Catalog و مبانی حاکمیت داده
- جدولهای مدیریتشده در مقابل خارجی
- ایجاد کاتالوگها، طرحوارهها، جداول و حجمها
- شروع کار با ETL و Apache Spark
- درک مدل داده Olist
- مبانی ETL لایه برنز
- کاوش در دیتافریمهای برنز
- جداول خارجی و دسترسی به دادههای خام
- تشخیص کلیدهای تکراری در برنز
- پروفایل مقادیر گمشده در برنز
- بررسیهای نهایی قبل از حرکت به نقره
- پاکسازی و نرمالسازی جدول مشتریان
- تبدیل جدول فروشندگان
- پاکسازی و غنیسازی جدول محصولات (ترکیب همه درسها)
- مدیریت زمان، کیفیت و دادههای گمشده در جدول سفارشات (ترکیب همه درسها)
- تبدیل Order_Items و بررسیهای کیفیت (ترکیب همه درسها)
- اعتبارسنجی و تبدیل دادههای پرداخت (ترکیب همه درسها)
- ساخت نسخه نقرهای Order Reviews (ترکیب همه درسها)
- پاکسازی و حذف دادههای تکراری مکانها (ترکیب همه درسها)
- آمادهسازی جداول مرجع پاک در نقره
- تحلیل توزیع مشتریان
- معیارهای فروشنده و تحلیل پارتو
- تحلیل دستهبندی محصولات بر اساس وزن، حجم و چگالی
- درک داستانهای تحلیلی لایه طلا
- تحلیل یکپارچه سفارشات طلا (ترکیب همه درسها)
- طراحی جوینهای تحلیلی برای بینشهای باکیفیت
پیشنیازهای دوره
- یک کامپیوتر فعال (ویندوز، مک، یا لینوکس)
- یک اتصال اینترنتی پایدار برای دسترسی به Databricks
- درک اولیه از پایتون (توابع، حلقهها، متغیرها - فقط موارد ضروری)
- درک اولیه از SQL (پرسوجوهای پایه مانند SELECT ،WHERE ،JOIN کافی است)
- علاقه به مهندسی داده و پایپ لاین های داده در دنیای واقعی
- کنجکاوی در مورد پلتفرمهای ابری مدرن و گردشهای کاری ETL در مقیاس بزرگ
- انگیزه برای ساخت پایپ لاین های کامل سرتاسری با استفاده از Databricks و Apache Spark
- نیاز به تجربه قبلی با Databricks، Spark، یا Lakehouse نیست.
- فقط شما، صفحه کلیدتان، و اشتیاق شما برای تبدیل شدن به یک مهندس داده!
توضیحات دوره
به دوره “آموزش Databricks - تسلط به مهندسی داده Spark ETL و Delta Lake” خوش آمدید.
Databricks را از Spark ETL گرفته تا Unity Catalog و خطوط لایه مدالیون برای ساخت گردشهای داده مقیاسپذیر و تأثیرگذار بیاموزید.
در دنیای دادهمحور امروز، توانایی ساخت پایپ لاین های داده مقیاسپذیر با استفاده از پلتفرمهای ابری مدرن یک ابرقدرت واقعی است - و هیچجا این تأثیر بیشتر از تسلط بر Databricks، Apache Spark، و معماری Lakehouse نیست.
در این دوره جامع، شما یاد خواهید گرفت که چگونه مجموعه دادههای خام را با استفاده از معماری کامل مدالیون (برنز ← نقره ← طلا) به دادههای پاک، قابل اعتماد و آماده برای تحلیل تبدیل کنید، در حالی که مهارتهای عملی مورد انتظار از مهندسان داده آماده به کار را توسعه میدهید.
Databricks قدرت پردازش Apache Spark را با انعطافپذیری Lakehouse ترکیب میکند و متخصصان را قادر میسازد تا دادهها را به طور کارآمد مدیریت، پاکسازی و تحلیل کنند. چه یک مهندس داده مشتاق باشید، چه دانشجو یا یک حرفهای شاغل، این دوره شما را به طرز فکر، تکنیکها و مهارتهای عملی برای ساخت پایپ لاین های داده مدرن بر روی یکی از پرتقاضاترین پلتفرمهای جهان مجهز میکند.
چرا این دوره؟
ساخت پایپ لاین های داده در سازمانهای واقعی پیچیده و نامرتب است. مجموعه دادههای خام حاوی ناسازگاریها، مقادیر گمشده، دادههای تکراری و سایر چالشهای دنیای واقعی هستند. Databricks این مشکلات را با ترکیب قابلیتهای محاسبات توزیعشده Apache Spark با ابزارهای حاکمیتی در سطح سازمانی مانند Unity Catalog حل میکند.
در این دوره، گام به گام یاد خواهید گرفت که چگونه دادهها را در حین تسلط به ابزارهایی مانند موارد زیر پاکسازی، تبدیل، اعتبارسنجی و تحلیل کنید:
- ساخت پایپ لاین های داده سرتاسری با استفاده از Apache Spark در Databricks
- به کارگیری مطمئن معماری مدالیون (برنز ← نقره ← طلا)
- استفاده از Unity Catalog برای حاکمیت داده امن و مقیاسپذیر
- پاکسازی، تبدیل، غنیسازی و تحلیل مجموعه دادههای دنیای واقعی
- اعمال بررسیهای کیفیت داده، نرمالسازی و عملیات پیشرفته Spark
- کار کارآمد با گردشهای کاری نوتبوک و محاسبات Databricks
- ایجاد مجموعه دادههای تحلیلی آماده برای داشبوردها، ابزارهای هوش تجاری (BI) یا یادگیری ماشین
- توسعه طرز فکر و مهارتهای یک مهندس داده حرفهای که با سیستمهای داده پیچیده در سطح تولید کار میکند.
شما یک پایپ لاین کامل سرتاسری - از دریافت داده خام تا تحلیلهای باارزش - درست مانند یک مهندس داده حرفهای که امروزه در محیطهای ابری کار میکند، خواهید ساخت.
در پایان، شما نه تنها Databricks را درک خواهید کرد... مانند یک مهندس داده فکر خواهید کرد.
چرا تسلط به Databricks و Spark اهمیت دارد؟
Databricks و Apache Spark در قلب مهندسی داده مدرن قرار دارند. با حرکت شرکتها به سمت مدل Lakehouse، متخصصانی که تبدیلهای Spark، قابلیت اطمینان Delta Lake و حاکمیت Unity Catalog را درک میکنند، تقاضای بسیار بالایی دارند.
این دوره به شما میدهد:
- اصول فنی برای کار با دادههای بزرگ
- تجربه عملی برای ساخت پایپ لاین های مقیاسپذیر
- اعتماد به نفس برای فعالیت در محیطهای ابری دنیای واقعی
Databricks چیست و چگونه در مهندسی داده مدرن استفاده میشود؟
Databricks یک پلتفرم مهندسی داده مبتنی بر ابر است که Apache Spark را برای پردازش ETL با کارایی بالا یکپارچه میکند. این پلتفرم به مهندسان داده اجازه میدهد تا پایپ لاین های داده مقیاسپذیر بسازند، جداول Delta Lake را با تراکنشهای ACID مدیریت کنند، و معماری مدالیون (برنز ← نقره ← طلا) را برای تبدیل مجموعه دادههای خام به دادههای آماده برای تحلیل پیادهسازی کنند. Databricks همچنین گردشهای کاری نوتبوک، حاکمیت داده با Unity Catalog و ابزارهایی برای مقابله با چالشهای داده دنیای واقعی مانند ناسازگاریها، مقادیر گمشده و دادههای تکراری فراهم میکند و آن را به یک راهحل جامع برای گردشهای کاری داده مدرن تبدیل میکند.
چرا یادگیری Apache Spark در Databricks برای مهندسان داده ضروری است؟
یادگیری Apache Spark در Databricks ضروری است زیرا مهندسان داده را قادر میسازد تا با استفاده از محاسبات توزیعشده، مجموعه دادههای عظیم را به طور کارآمد پردازش کنند. Spark در Databricks از تبدیلهای موازیسازی شده، پاکسازی پیشرفته داده و تحلیلهای بلادرنگ پشتیبانی میکند. مهندسان داده میتوانند پایپ لاین های برنز، نقره و طلا را پیادهسازی کنند، بررسیهای کیفیت داده را اعمال کنند، مجموعه دادهها را غنیسازی کنند و دادههای تحلیلی باارزش را برای داشبوردها، ابزارهای هوش تجاری یا مدلهای یادگیری ماشین آماده کنند. تسلط بر Spark در Databricks مهارتهای عملی و تجربه آماده به کار در صنعت مورد نیاز برای مدیریت سیستمهای داده پیچیده در سطح تولید در محیطهای ابری را فراهم میکند.
معماری مدالیون در Databricks چیست و چرا برای پایپ لاین های داده مهم است؟
معماری مدالیون در Databricks دادهها را در لایههای برنز، نقره و طلا سازماندهی میکند و تضمین میکند که دادههای خام به تدریج برای تحلیل پاکسازی، اعتبارسنجی و غنیسازی میشوند. لایه برنز دادههای خام دریافت شده را ذخیره میکند، نقره مجموعه دادههای تنظیمشده و استاندارد را فراهم میکند، و طلا دادههای تحلیلی باارزش آماده برای داشبوردها، گزارشها یا یادگیری ماشین را تحویل میدهد. این معماری به مهندسان داده اجازه میدهد تا پایپ لاین های قوی، مقیاسپذیر و قابل اعتماد بسازند، کیفیت داده را حفظ کنند و با استفاده از Delta Lake و Unity Catalog، حاکمیت داده در سطح سازمانی را امکانپذیر سازند، که این امر آن را برای هر گردش کار مهندسی داده مدرن ضروری میسازد.
چرا باید در این دوره شرکت کنید؟
پاسخ ما ساده است: کیفیت تدریس
آکادمی OAK مستقر در لندن، یک شرکت آموزش آنلاین است. آکادمی OAK در زمینه فناوری اطلاعات، نرمافزار، طراحی و توسعه به زبانهای ترکی، انگلیسی، پرتغالی و بسیاری زبانهای دیگر در پلتفرم Udemy آموزش ارائه میدهد، جایی که بیش از 2000 ساعت ویدئوی آموزشی در آن موجود است.
هنگام شرکت در دوره، تخصص توسعهدهندگان باتجربه آکادمی OAK را احساس خواهید کرد.
کیفیت تولید ویدئو و صدا
تمام محتوای ما به صورت ویدئو/صدای با کیفیت بالا ایجاد/تولید میشود تا بهترین تجربه یادگیری را به شما ارائه دهد
شما خواهید توانست،
- به وضوح ببینید.
- به وضوح بشنوید.
- بدون حواسپرتی در دوره پیش بروید.
همین حالا به دوره "آموزش Databricks - تسلط به مهندسی داده Spark ETL و Delta Lake" بپیوندید.
Databricks را از Spark ETL گرفته تا Unity Catalog و خطوط لایه مدالیون برای ساخت گردشهای داده مقیاسپذیر و تأثیرگذار بیاموزید.
این دوره برای چه کسانی مناسب است؟
- هر کسی که میخواهد مهندسی داده را از طریق گردشهای کاری واقعی و سرتاسری Databricks یاد بگیرد.
- دانشجویان، تحلیلگران یا حرفهایهای علاقهمند به Databricks، Apache Spark یا پلتفرمهای داده مدرن
- کسانی که به دنبال یک راهنمای عملی برای ساخت پایپ لاین های ETL با استفاده از معماری Lakehouse و مدالیون (برنز-نقره-طلا) هستند.
- هر کسی که کنجکاو است بداند سیستمهای داده در مقیاس بزرگ در سازمانهای دنیای واقعی چگونه کار میکنند.
- یادگیرندگانی که میخواهند مهارتهای پایتون و SQL خود را از طریق پروژههای عملی مهندسی داده تقویت کنند.
- مهندسان داده مشتاقی که به دنبال کسب تجربه آماده به کار در صنعت با Spark ،Unity Catalog و اکوسیستم Databricks هستند.
آموزش Databricks - تسلط به مهندسی داده Spark ETL و Delta Lake
-
مرور کلی دوره و مسیر یادگیری 02:45
-
تجزیه و تحلیل راهنمای آزمون 03:39
-
Databricks چیست و چرا مهندسی داده؟ 03:54
-
ایجاد محیط رایگان Databricks خود 03:48
-
پیمایش در رابط کاربری Databricks 11:06
-
چگونگی اتصال اجزای Databricks - درس 1 04:48
-
چگونگی اتصال اجزای Databricks - درس 2 08:52
-
مدیریت فایل و نوتبوک در Databricks 06:26
-
گزینههای محاسباتی Databricks - درس 1 07:00
-
گزینههای محاسباتی Databricks - درس 2 10:09
-
تنظیمات کلاستر Databricks: راهنمای نظری و آمادگی برای صدور گواهینامه 07:17
-
Databricks، نوتبوک دیجیتال و آزمایشگاه شما - درس 1 04:05
-
Databricks، نوتبوک دیجیتال و آزمایشگاه شما - درس 2 07:39
-
Databricks، نوتبوک دیجیتال و آزمایشگاه شما - درس 3 05:57
-
فرمان های ضروری نوتبوک در Databricks 11:16
-
میانبرهای هوشمند در Databricks 08:43
-
Lakehouse چیست؟ - پلتفرم داده یکپارچه 07:02
-
درک لایههای مدالیون (برنز، نقره، طلا) 09:42
-
تراکنشهای ACID و لاگ تراکنش 07:50
-
از DBFS تا Unity Catalog: تکامل حاکمیت داده 10:07
-
درک لایههای Unity Catalog 08:28
-
جدولهای مدیریتشده در مقابل خارجی در Unity Catalog 13:26
-
ایجاد یک Unity Catalog 11:30
-
ایجاد جداول مدیریتشده - درس 1 12:59
-
ایجاد جداول مدیریتشده - درس 2 06:38
-
ایجاد حجمها - درس 1 11:46
-
ایجاد حجمها - درس 2 06:10
-
شروع کار با ETL و Apache Spark 07:32
-
درک مدل داده 08:19
-
اولین گامهای ETL (استخراج) با Apache Spark - درس 1 18:39
-
اولین گامهای ETL (استخراج) با Apache Spark - درس 2 09:25
-
اولین گامهای ETL (استخراج) با Apache Spark - درس 3 06:02
-
کاوش در تمام دیتافریمهای برنز با PySpark 10:46
-
جداول خارجی: استفاده از داده خارجی بدون آوردن آن به Databricks 09:11
-
تشخیص کلیدهای تکراری در لایه برنز 08:36
-
پروفایل مقادیر گمشده در لایه برنز 25:06
-
بررسیهای نهایی قبل از حرکت به لایه نقره - درس 1 08:24
-
بررسیهای نهایی قبل از حرکت به لایه نقره - درس 2 05:53
-
پاکسازی و نرمالسازی جدول مشتریان - درس 1 05:42
-
پاکسازی و نرمالسازی جدول مشتریان - درس 2 17:33
-
فروشندگان Olist: تبدیل برنز به نقره - درس 1 11:51
-
فروشندگان Olist: تبدیل برنز به نقره - درس 2 14:16
-
پاکسازی و غنیسازی جدول محصولات - درس 1 08:46
-
پاکسازی و غنیسازی جدول محصولات - درس 2 06:48
-
پاکسازی و غنیسازی جدول محصولات - درس 3 10:43
-
پاکسازی و غنیسازی جدول محصولات - درس 4 13:06
-
پاکسازی و غنیسازی جدول محصولات - درس 5 11:00
-
مدیریت زمان، کیفیت و دادههای گمشده در جدول سفارشات - درس 1 10:05
-
مدیریت زمان، کیفیت و دادههای گمشده در جدول سفارشات - درس 2 09:11
-
مدیریت زمان، کیفیت و دادههای گمشده در جدول سفارشات - درس 3 10:48
-
مدیریت زمان، کیفیت و دادههای گمشده در جدول سفارشات - درس 4 09:35
-
مدیریت زمان، کیفیت و دادههای گمشده در جدول سفارشات - درس 5 14:18
-
تبدیل دادههای Order_Items و بررسیهای کیفیت - درس 1 14:38
-
تبدیل دادههای Order_Items و بررسیهای کیفیت - درس 2 13:05
-
تبدیل دادههای Order_Items و بررسیهای کیفیت - درس 3 08:37
-
اعتبارسنجی و تبدیل دادههای پرداخت - درس 1 07:35
-
اعتبارسنجی و تبدیل دادههای پرداخت - درس 2 07:48
-
اعتبارسنجی و تبدیل دادههای پرداخت - درس 3 08:56
-
اعتبارسنجی و تبدیل دادههای پرداخت - درس 4 03:59
-
ساخت نسخه نقرهای order_reviews - درس 1 08:48
-
ساخت نسخه نقرهای order_reviews - درس 2 10:37
-
ساخت نسخه نقرهای order_reviews - درس 3 14:09
-
پاکسازی و حذف دادههای تکراری مکان - درس 1 08:41
-
پاکسازی و حذف دادههای تکراری مکان - درس 2 09:18
-
پاکسازی و حذف دادههای تکراری مکان - درس 3 11:40
-
پاکسازی و حذف دادههای تکراری مکان - درس 4 08:54
-
جداول مرجع پاک در لایه نقره 05:44
-
تحلیل توزیع مشتریان - درس 1 12:14
-
تحلیل توزیع مشتریان - درس 2 20:26
-
معیارهای فروشنده و مصورسازی پارتو - درس 1 06:28
-
معیارهای فروشنده و مصورسازی پارتو - درس 2 20:40
-
تحلیل دستهبندی محصولات بر اساس وزن، حجم و چگالی - درس 1 09:31
-
تحلیل دستهبندی محصولات بر اساس وزن، حجم و چگالی - درس 2 08:50
-
تحلیل دستهبندی محصولات بر اساس وزن، حجم و چگالی - درس 3 10:11
-
لایه طلا - هر جدول داستان خود را بازگو میکند 13:25
-
تحلیل یکپارچه سفارشات طلا - درس 1 08:23
-
تحلیل یکپارچه سفارشات طلا - درس 2 06:30
-
تحلیل یکپارچه سفارشات طلا - درس 3 11:58
-
تحلیل یکپارچه سفارشات طلا - درس 4 14:37
-
تحلیل یکپارچه سفارشات طلا - درس 5 08:39
-
طراحی جوینهای تحلیلی در لایه طلا 07:59
مشخصات آموزش
آموزش Databricks - تسلط به مهندسی داده Spark ETL و Delta Lake
- تاریخ به روز رسانی: 1404/12/10
- سطح دوره:همه سطوح
- تعداد درس:81
- مدت زمان :13:07:19
- حجم :5.06GB
- زبان:دوبله زبان فارسی
- دوره آموزشی:AI Academy