یکپارچهسازی Kafka DBT Databricks AI (LLM) - شش پروژه لایو
✅ سرفصل و جزئیات آموزش
آنچه یاد خواهید گرفت:
- ساخت پایپلاینهای داده بلادرنگ با کافکا
- تبدیل داده تحلیلی با DBT
- پردازش داده استریمینگ و داده دستهای با Databricks
- یکپارچهسازی هوش مصنوعی با چتباتهای مجهز به LLM
پیشنیازهای دوره
- سطح اولیه از تجربه برنامهنویسی پایتون همراه با SQL نیاز است.
توضیحات دوره
ما از تجربهها و چالشهای خود هنگام یادگیری از ویدئوهای آنلاین استفاده کردیم. در وب پروژههای ساده زیادی وجود دارد، اما در محیط واقعی کار، شما به عمق و تجربه یکپارچهسازی در کار با چندین ابزار DATA نیاز دارید.
به همین دلیل فکر کردیم ساخت پروژههایی با بهبودهای تدریجی، بهترین راه برای حذف شلوغیها و تبدیل شدن به کارشناس واقعی یکپارچهسازی Databricks است. کسی که فقط در Databricks متخصص نیست، بلکه میداند چگونه پیامها را با کافکا یکپارچه کند، SQL ماژولار را با پایگاه داده بسازد، از rest API داده دریافت کند و قابلیتهای هوش مصنوعی (LLM) را هم ارائه دهد.
خلاصه
کدنویسی لایو از مهندسی داده End-to-End (نه فقط ابزارها)
آموزش اصلی دوره این است که داده چگونه از منبع به بینش میرسد و موارد زیر را پوشش میدهد:
- جذب داده رویداد محور با آپاچی کافکا
- تبدیلهای تحلیلی با dbt Labs
- پردازش یکپارچه داده دستهای و استریمینگ با استفاده از Databricks
یادگیرندگان درک میکنند که هر کامپوننت چرا وجود دارد، نه فقط اینکه چگونه روی دکمهها کلیک کنند.
این دوره اول مهندسی است، نه مجموعهای از اسلاید
مهندسی داده تقویت شده با هوش مصنوعی و LLMs
یکی از تفاوتهای مهم دوره آموزش موارد زیر است:
- چگونه یک چتبات مجهز به LLM متصل به پایپلاینها بسازید؟
- استفاده از هوش مصنوعی برای توضیح تبدیلها، شناسایی مشکلات داده و کمک به اشکالزدایی
- اعمال LLMs برای تحلیل خود سرویس و قابلیت مشاهده پلتفرم
در این دوره، هوش مصنوعی به عنوان یک شتابدهنده عملی آموزش داده میشود، نه یک نظریه انتزاعی
لیست پروژههایی که در طول ویدئوها و به صورت لایو کدنویسی میکنیم:
- پروژه 1 - با یک پروژه ساده شروع میکنیم. پیشبینی مسکن نسخه 1 از scikitlearn استفاده میکند.
- پروژه 2 - پروژه 1 را ارتقا میدهیم. پیشبینی مسکن نسخه 2 از چندین مدل یادگیری ماشین و حدود 40 ویژگی استفاده میکند.
- پروژه 3 - با افزودن چتبات مبتنی بر LLM و کوئریهای ساختاریافته، پروژه را بیشتر ارتقا میدهیم.
- پروژه 4 - پروژه 2 را حتی بیشتر ارتقا میدهیم تا آماده برای سازمان شود. در اینجا چتبات را با استفاده از LLM و کوئریهای بدون ساختار (متن آزاد مانند واتساپ) با کمک LLM و OpenAI اضافه میکنیم.
- پروژه 5 - در اینجا روی مهارتهای یکپارچهسازی و یکپارچهسازی پیامهای استریمینگ با Databricks تمرکز میکنیم.
- پروژه 6 - در اینجا روی مهارتهای یکپارچهسازی و یکپارچهسازی پیامهای استریمینگ با DBT و Databricks همراه با بهبودها تمرکز میکنیم.
با انجام پروژههای یکپارچهسازی داده، خیلی سریع به متخصص یکپارچهسازی DATABRICKS (نه فقط کاربر ابزار databricks) تبدیل میشوید.
این دوره برای چه کسانی مناسب است؟
- مهندسان داده (جوان به ارشد) - متخصصانی که با تمرکز قوی بر کدنویسی لایو و الگوهای واقعی، میخواهند تجربه عملی و شبیه محیط تولید در ساخت پایپلاینهای داده بلادرنگ و دستهای با استفاده از آپاچی کافکا و dbt Labs و Databricks داشته باشند.
- مهندسان تحلیل و توسعهدهندگان BI - افرادی که مسئول تبدیل داده خام به مدلهای آماده تحلیل هستند و میخواهند فراتر از SQL استاتیک بروند، بهترین شیوهها در dbt را یاد بگیرند و درک کنند که داده استریمینگ چگونه وارد لایههای تحلیلی میشود.
- دانشجویان پیشرفته و تغییردهندگان شغل - یادگیرندگانی که از قبل SQL و پایتون اولیه را میدانند به دنبال تجربه عملی و در سطح صنعت هستند و برای نقشهای واقعی مهندسی داده آماده میشوند.
- مهندسان هوش مصنوعی و یادگیری ماشین و دانشمندان داده (تمرکز کاربردی) - یادگیرندگانی که به یکپارچهسازی چتباتهای مجهز به LLM با پلتفرمهای داده علاقه دارند تا پایپلاینها را با زبان طبیعی کوئری کنند، تبدیلها و مشکلات کیفیت داده را توضیح دهند و گردشکارهای مهندسی داده با کمک هوش مصنوعی بسازند.
- برای مبتدیان مطلق بدون پیشزمینه SQL یا برنامهنویسی مناسب نیست. یادگیرندگانی که فقط به دنبال تئوری یا حفظ کردن مطالب برای گواهینامه هستند.
یکپارچهسازی Kafka DBT Databricks AI (LLM) - شش پروژه لایو
-
بررسی دوره 14:26
-
DataFlow -> پیشبینی مسکن نسخه 1 و نسخه 2 04:19
-
بررسی کد پیشبینی مسکن نسخه 1 07:28
-
ایمپورت داده از Kaggle Hub API 22:53
-
نرمالسازی با استفاده از مقادیر میانه و تبدیل به ستونهای استاندارد 09:13
-
نوشتن کد آموزش مدل با استفاده از ScikitLearn 08:00
-
کدگذاریOne Hot - تبدیل ستونهای دستهبندی به فرم باینری 06:29
-
ساخت منطق دقت 04:18
-
ذخیره پیشبینیها در جداول دلتا 06:40
-
اجرای مدل 03:51
-
بررسی کد - پیشبینی قیمت مسکن نسخه 2 14:35
-
افزودن ویژگیهای بیشتر به مدل پیشبینی قیمت مسکن نسخه 1 - برای مثال جمعیتشناسی، شهر و آبوهوا 05:19
-
ایجاد مجموعه داده (به تیم تست وابسته نباشید) 14:05
-
جوین کردن ویژگیهای جدید با مجموعه داده موجود 11:16
-
مهندسی ویژگی برای غنیسازی داده - برای مثال استخراج سن از ستون dob 12:48
-
تحلیل اکتشافی داده با استفاده از matplotlib و seaborn روی مجموعه داده تازه ساخته شده 09:30
-
تحلیل اکتشافی داده - ادامه 09:06
-
Split Train and Test و فریمورک KFold - اجرای بررسی امتیازهای F1 17:05
-
DATAFLOW - پروژه 3 و پروژه 4 - چتبات نسخه 1 و چتبات نسخه 2 05:31
-
بررسی کد - چتبات نسخه 1 04:49
-
ایمپورت کتابخانهها و پیکربندی برای استفاده از مدل پیشبینی مسکن 14:24
-
تعریف فیلدهای ورودی در چتبات بر اساس مدل پیشبینی مسکن 12:48
-
ساخت تابع مهندسی ویژگی - بخش 1 14:30
-
ساخت تابع مهندسی ویژگی - بخش 2 21:14
-
ترازبندی داده ورودی با اسکیمای دقیق استفاده شده در آموزش مدل - بخش 1 08:33
-
ترازبندی داده ورودی با اسکیمای دقیق استفاده شده در آموزش مدل - بخش 2 19:35
-
اشکالزدایی مشکلات و در نهایت اجرای چتبات با کوئریهای ساختاریافته 05:15
-
بررسی کد - چتبات نسخه 2 با استفاده از LLM Prompt Engg و OpenAI 05:42
-
راهاندازی دسترسی به توکن Databricks OpenAI با استفاده از LLM متنباز میزبانی شده توسط Databricks 02:19
-
نرمالسازی خروجی از ویژگی LLM مطابق چیزی که چتبات نسخه 1 انتظار دارد - بخش 1 09:09
-
نرمالسازی خروجی از ویژگی LLM مطابق چیزی که چتبات نسخه 1 انتظار دارد - بخش 2 12:30
-
اجرای چتبات با استفاده از متن آزاد (برای مثال واتساپ و facebook messenger) 23:40
-
DATAFLOW - پردازش داده بیتکوین با استفاده از کافکا، Databricks و DBT 06:30
-
چگونه DBT را با Databricks یکپارچه کنیم و چرا؟ 17:32
-
بررسی کد 05:41
-
فراخوانی برای دریافت داده کوین مارکت و پیکربندی در Databricks 07:02
-
ساخت تابع برای نگهداری داده کوین مارکت - بخش 1 20:37
-
ساخت تابع برای نگهداری داده کوین مارکت - بخش 2 21:13
-
داده استریمینگ پیوسته از API کوین مارکت در تاپیک کافکا 14:48
-
بررسی کد 05:27
-
واکشی داده از کافکا و ذخیره در جداول دلتا Databricks - بخش 1 14:00
-
واکشی داده از کافکا و ذخیره در جداول دلتا Databricks - بخش 2 15:08
-
واکشی داده از کافکا و ذخیره در جداول دلتا Databricks در Append mode 27:07
-
تبدیل داده جدول دلتا با استفاده از DBT برای تولید نمودار نسب داده 15:39
-
ایجاد داشبوردها برای داده کپ کوین مارکت 21:32
-
گزارش 10 دارایی برتر رشدکننده - کدام داراییها سریع در حال حرکت هستند؟ 05:53
-
گزارش همبستگی روی نمودار پراکندگی - آیا قیمت و حجم به هم مرتبط هستند؟ 11:24
مشخصات آموزش
یکپارچهسازی Kafka DBT Databricks AI (LLM) - شش پروژه لایو
- تاریخ به روز رسانی: 1405/04/02
- سطح دوره:متخصص
- تعداد درس:47
- مدت زمان :09:03:32
- حجم :5.24GB
- زبان:دوبله زبان فارسی
- دوره آموزشی:AI Academy