دوره آموزشی
The Great Courses
دوبله زبان فارسی

کلان‌ داده: Hadoop - MapReduce - Hive - Pig - NoSQL - Mahout - Oozie

کلان‌ داده: Hadoop - MapReduce - Hive - Pig - NoSQL - Mahout - Oozie

✅ سرفصل و جزئیات آموزش

آنچه یاد خواهید گرفت:

  • مقدمه‌ای بر کلان‌داده و Hadoop. مروری بر آموزش Hadoop. سناریوی کلان‌داده Hadoop. معماری Hadoop و HDFS
  • فایل سیستم توزیع‌شده Hadoop. اصول Hadoop MapReduce. تکنیک‌های پیشرفته MapReduce. اصول و مفاهیم پیشرفته HIVE.
  • مبانی و تکنیک‌های پیشرفته PIG. اصول NoSQL. Apache Mahout برای یادگیری ماشین. Apache Oozie برای ارکستراسیون گردش کار
  • Apache Flume برای دریافت داده. Apache Storm برای پردازش داده بلادرنگ. Apache Avro برای سریال‌سازی داده. اصول و مفاهیم پیشرفته Apache Spark
  • پروژه‌های عملی Hadoop در حوزه‌های گوناگون. Hadoop در محیط Cloudera. تحلیل داده لاگ با Hadoop. تحلیل شبکه‌های اجتماعی با Hadoop
  • تحلیل داده YouTube با Hadoop. تحلیل نظرسنجی سلامت با استفاده از HDFS. تحلیل تخلفات ترافیکی. تحلیل فروش تجارت الکترونیک.
  • Hive/MapReduce برای تحلیل شکایات مشتریان. تحلیل داده حسگر با استفاده از PIG/MapReduce و Spark Streaming برای تحلیل داده توییتر
  • تحلیل صنعت مخابرات با استفاده از Hive مدیریت داده اعضای هیئت علمی با HDFS تحلیل نظرسنجی گردشگری. تحلیل حقوق و دستمزد
  • درک جامع از فناوری‌های کلان‌داده

پیش‌نیازهای دوره

  • دانش اولیه کامپیوتر
  • دانش اولیه جاوا و SQL یک مزیت محسوب می‌شود.
  • به دانش قبلی نیاز نیست. دوره از ابتدا شروع می‌شود و با پروژه‌های گوناگون به سطح پیشرفته می‌رسد.
  • برای شرکت در این دوره Hadoop به مهارت خاصی نیاز ندارید.

توضیحات دوره

به دوره جامع کلان‌داده و Hadoop خوش آمدید! در این دوره، به بررسی دنیای فناوری‌های کلان‌داده می‌پردازیم و بر روی Hadoop، یکی از قدرتمندترین و پرکاربردترین چارچوب‌ها برای پردازش مجموعه‌داده بزرگ، تمرکز می‌کنیم.

در طول این دوره، اصول Hadoop شامل معماری، کامپوننت ها و کاربردهای آن را فرا خواهید گرفت. همه چیز را از اصول اولیه کلان‌داده و Hadoop تا مباحث پیشرفته‌ای مانند MapReduce ،HDFS ،Hive ،Pig و موارد دیگر پوشش خواهیم داد.

چه مبتدی باشید که به دنبال درک اصول کلان‌داده است و چه یک متخصص باتجربه که به دنبال ارتقای مهارت‌های خود در فناوری‌های اکوسیستم Hadoop است، این دوره برای همه چیزی دارد. آماده شوید تا حوزه هیجان‌انگیز کلان‌داده را بررسی کنید و قدرت Hadoop را برای حل چالش‌های داده در دنیای واقعی آزاد کنید. به ما در این سفر بپیوندید تا پتانسیل کلان‌داده را با هم آزاد کنیم! مباحث زیر را به تفکیک بخش فرا خواهیم گرفت:

بخش 1: مقدمه‌ای بر آموزش کلان‌داده و Hadoop

در این بخش، دانشجویان با مفاهیم اساسی آموزش کلان‌داده و Hadoop آشنا می‌شوند. آن‌ها با درک اهمیت Hadoop در مدیریت کارآمد حجم عظیمی از داده، کار خود را آغاز می‌کنند. از طریق یک سری جلسات مقدماتی، یادگیرندگان با چشم‌انداز فناوری کلان‌داده و Hadoop آشنا می‌شوند و زمینه را برای بررسی عمیق‌تر در بخش‌های بعدی فراهم می‌کنند.

بخش 2: معماری Hadoop و HDFS

این بخش با حرکت به سمت معماری Hadoop و فایل سیستم توزیع‌شده آن (HDFS)، به بررسی کامپوننت های اصلی Hadoop 1.0 می‌پردازد. دانشجویان در مورد لایه ذخیره‌سازی Hadoop و سیاست‌های جانمایی حاکم بر توزیع داده در سراسر خوشه، بینش پیدا می‌کنند. از طریق تمرین‌های عملی و آموزش‌های راه‌اندازی خوشه، یادگیرندگان درک محکمی از معماری Hadoop و پیاده‌سازی عملی آن در سناریوهای واقعی به دست می‌آورند.

بخش 3: اصول MapReduce

در این بخش، دانشجویان به بررسی اصول MapReduce، یکی از کامپوننت اصلی Hadoop برای پردازش و تحلیل موازی مجموعه‌داده بزرگ، می پردازند. از طریق یک سری سخنرانی، یادگیرندگان مفاهیم کلیدی مانند مرتب‌سازی ثانویه، کلیدهای ترکیبی و اهمیت پارتیشن‌بندی را بررسی می‌کنند. آن‌ها با کار روی برنامه‌های نمونه، درک joinهای سمت map و پیاده‌سازی combinerها برای پردازش کارآمد داده، تجربه عملی در برنامه‌نویسی MapReduce به دست می‌آورند.

بخش 4: MapReduce پیشرفته

این بخش بر اساس دانش اساسی MapReduce، به مباحث و تکنیک‌های پیشرفته‌تری برای بهینه‌سازی برنامه‌های MapReduce می‌پردازد. دانشجویان در مورد اجرا و اشکال‌زدایی برنامه‌های MapReduce، کار با فرمت‌های مختلف فایل و استفاده از قابلیت‌های پیشرفته MapReduce برای کارهایی مانند پردازش لاگ و اکسپورت کردن داده می‌آموزند. تا پایان این بخش، یادگیرندگان به مهارت‌هایی برای مقابله با چالش‌های پیچیده پردازش داده با استفاده از MapReduce مجهز می‌شوند.

بخش 5: اصول HIVE

در این بخش، دانشجویان با Apache Hive، یک زیرساخت انبار داده ساخته شده روی Hadoop برای کوئری و تحلیل مجموعه‌داده بزرگ ذخیره‌شده در HDFS، آشنا می‌شوند. از طریق یک سری سخنرانی، یادگیرندگان معماری Hive، مفاهیم مدل‌سازی داده و زبان کوئری آن (HiveQL) را بررسی می‌کنند. آن‌ها یاد می‌گیرند چگونه پایگاه‌های داده و جدول‌ها را ایجاد و مدیریت کنند، عملیات بارگذاری داده را انجام دهند و کوئری های شبه SQL مختلفی را برای استخراج بینش از داده ساختاریافته اجرا کنند.

بخش 6: Hive پیشرفته

این بخش با گسترش دانش بنیادین Hive، مباحث و تکنیک‌های پیشرفته را برای بهینه‌سازی پرس‌وجوهای Hive و گردش‌های کاری پردازش داده پوشش می‌دهد. دانشجویان در مورد پارتیشن‌بندی، bucketing، ایندکس‌گذاری و سایر راهبردهای بهینه‌سازی عملکرد برای افزایش کارایی پرس‌وجو و مقیاس‌پذیری می‌آموزند. علاوه بر این، ویژگی‌های پیشرفته‌ای مانند نمونه‌برداری جدول، بایگانی و کار با ابعاد با تغییر آهسته (SCD) را برای پاسخگویی مؤثر به نیازهای پیچیده تحلیل داده بررسی می‌کنند.

بخش 7: اصول PIG

در این بخش، دانشجویان Apache Pig، یک زبان اسکریپت‌نویسی جریان داده سطح بالا برای پردازش و تحلیل مجموعه‌داده بزرگ در Hadoop را بررسی می‌کنند. از طریق یک سری سخنرانی، یادگیرندگان ویژگی‌های Pig، انواع داده و عملگرهای آن را برای بیان مختصر تبدیل‌های داده و تسک های تحلیلی کشف می‌کنند. آن‌ها با بارگذاری و ذخیره‌سازی داده، عملیات گروه‌بندی و join و استفاده از توابع داخلی برای انجام کارآمد تسک های دستکاری داده، تجربه عملی به دست می‌آورند.

بخش 8: PIG پیشرفته

این بخش بر اساس دانش اساسی Pig، به مباحث و تکنیک‌های پیشرفته برای بهینه‌سازی اسکریپت‌های Pig و گردش‌های کاری پردازش داده می‌پردازد. دانشجویان در مورد تکنیک‌های اشکال‌زدایی، استفاده از توابع تعریف‌شده توسط کاربر (UDF) و کار با انواع داده پیچیده برای رسیدگی مؤثر به نیازهای مختلف پردازش داده می‌آموزند. علاوه بر این، راهبردهایی برای بهبود عملکرد اسکریپت Pig و مقیاس‌پذیری آن در محیط‌های پردازش داده در مقیاس بزرگ بررسی می‌کنند.

بخش 9: اصول NoSQL

این بخش مقدمه‌ای بر پایگاه‌های داده NoSQL ارائه می‌دهد و تاریخچه، ویژگی‌ها و مزایای آن‌ها را در مدیریت انواع داده متنوع و سریع‌تغییر پوشش می‌دهد. دانشجویان در مورد انواع مختلف پایگاه‌های داده NoSQL، از جمله مبتنی بر سند، ستونی و گرافی می‌آموزند و مناسب بودن آن‌ها را برای موارد استفاده مختلف درک می‌کنند. علاوه بر این، یادگیرندگان مفاهیم کلیدی مانند انعطاف‌پذیری schema، مدل‌های سازگاری و معماری توزیع‌شده را بررسی کرده و برای مدیریت و کوئری داده در محیط‌های NoSQL بینش کسب می‌کنند.

بخش 10: Apache Mahout

در این بخش، دانشجویان Apache Mahout، یک کتابخانه یادگیری ماشین مقیاس‌پذیر ساخته شده روی Hadoop برای ساخت و استقرار مدل‌های یادگیری ماشین در مقیاس بزرگ را بررسی می‌کنند. از طریق یک سری درس و تمرین‌های عملی، یادگیرندگان معماری Mahout، الگوریتم‌ها و موارد استفاده آن را در سناریوهای واقعی کشف می‌کنند. آن‌ها تجربه عملی در پیاده‌سازی سیستم‌های توصیه‌گر، خوشه‌بندی، طبقه‌بندی و سایر تسک های یادگیری ماشین با استفاده از APIها و ابزارهای Mahout به دست می‌آورند.

بخش 11: Apache Oozie

این بخش Apache Oozie، یک سیستم زمان‌بند گردش کار برای مدیریت jobهای Hadoop و گردش‌های کاری پردازش داده را معرفی می‌کند. دانشجویان در مورد معماری Oozie، زبان تعریف گردش کار و اقدامات مختلف گردش کار برای هماهنگی و ارکستراسیون پایپ لاین های پیچیده پردازش داده می‌آموزند. از طریق تمرین‌های عملی، یادگیرندگان در ایجاد، زمان‌بندی و نظارت بر گردش‌های کار با استفاده از Oozie مهارت پیدا می‌کنند و قادر می‌شوند تسک های پردازش داده را به طور مؤثر خودکار و ساده‌سازی کنند.

بخش 12: Apache Flume

در این بخش، دانشجویان Apache Flume، یک سیستم توزیع‌شده، قابل اعتماد و در دسترس را برای جمع‌آوری، تجمیع و جابه‌جایی کارآمد حجم زیادی از داده لاگ از منابع مختلف به فروشگاه‌های داده متمرکز بررسی می‌کنند. از طریق درس ها و نمایش‌های عملی، یادگیرندگان معماری Flume، کامپوننت و مدل جریان داده را برای دریافت و پردازش داده لاگ در محیط‌های Hadoop درک می‌کنند. آن‌ها در پیکربندی عامل‌های Flume، تعریف پایپ لاین دریافت داده و نظارت بر جریان‌های داده برای پردازش بلادرنگ لاگ، تجربه عملی به دست می‌آورند.

بخش 13: Apache Storm

این بخش Apache Storm، یک سیستم پردازش جریانی بلادرنگ توزیع‌شده را برای پردازش جریان‌های داده با سرعت بالا با تأخیر کم و تحمل خطا معرفی می‌کند. دانشجویان در مورد معماری Storm، کامپوننت و مدل پردازش جریان، از جمله spoutها، boltها و توپولوژی‌ها می‌آموزند. از طریق تمرین‌های عملی، یادگیرندگان در راه‌اندازی خوشه‌های Storm، توسعه و استقرار توپولوژی‌های پردازش جریان و مدیریت جریان‌های داده بلادرنگ برای موارد استفاده مختلف مانند تحلیل‌های بلادرنگ، پردازش رویداد و موارد دیگر، تجربه عملی به دست می‌آورند.

بخش 14: Apache Avro

در این بخش، دانشجویان به بررسی Apache Avro، یک سیستم سریال‌سازی داده که ساختارهای داده غنی، فرمت باینری فشرده و یک مدل داده شبیه JSON را برای تبادل کارآمد داده بین اپلیکیشن ها فراهم می‌کند، می پردازنند. یادگیرندگان زبان تعریف schema، انواع داده پشتیبانی‌شده و ادغام با سایر ابزارهای کلان‌داده مانند Apache Sqoop را بررسی می‌کنند. از طریق مثال‌ها و تمرین‌های عملی، دانشجویان در استفاده از Avro برای سریال‌سازی داده، تکامل schema و قابلیت همکاری در اکوسیستم‌های Hadoop مهارت پیدا می‌کنند.

بخش 15: اصول Apache Spark

این بخش مقدمه‌ای بر Apache Spark، یک چارچوب محاسبات خوشه‌ای سریع و همه‌منظوره را برای پردازش مجموعه‌داده بزرگ با سرعت بالا و سهولت استفاده ارائه می‌دهد. دانشجویان در مورد کامپوننت های اصلی Spark، از جمله Spark Context، مجموعه‌داده توزیع‌شده مقاوم (RDD) و تبدیل‌ها/اقدامات برای پردازش داده توزیع‌شده می‌آموزند. از طریق آزمایشگاه‌های عملی و نمایش‌ها، یادگیرندگان در کار با RDDها، اعمال تبدیل‌ها/اقدامات و انجام تسک های اولهی تحلیل داده با استفاده از APIهای Spark تجربه عملی به دست می‌آورند.

بخش 16: Apache Spark پیشرفته

این بخش بر اساس اصول، عمیق‌تر به مفاهیم و ویژگی‌های پیشرفته Apache Spark می‌پردازد و دانشجویان را قادر می‌سازد تا به طور مؤثر با چالش‌های پیچیده پردازش داده و تحلیل مقابله کنند. یادگیرندگان مباحثی مانند اتصال Spark به منابع داده خارجی، کار با Spark SQL برای پردازش داده ساختاریافته و استفاده از کتابخانه‌های یادگیری ماشین و پردازش گراف Spark برای تسک های تحلیل پیشرفته را بررسی می‌کنند. از طریق ترکیبی از درس ها و تمرین‌های عملی، دانشجویان مهارت‌های پیشرفته‌ای در ساخت پایپ لاین های پردازش داده سرتاسری و استقرار مدل‌های یادگیری ماشین با استفاده از Spark توسعه می‌دهند.

بخش 17: پروژه Hadoop 01 - تحلیل داده فروش

در این بخش مبتنی بر پروژه‌، دانشجویان دانش خود را از Hadoop و فناوری‌های مرتبط برای تحلیل داده فروش و استخراج بینش‌های عملی به کار می‌گیرند. یادگیرندگان از طریق عبارات مسئله مختلف، مانند محاسبه میانگین فروش، تحلیل روندهای فروش و بخش‌بندی مشتریان بر اساس رفتار خرید، کار می‌کنند. با تکمیل این پروژه، دانشجویان تجربه عملی در تحلیل داده، ابزارهای اکوسیستم Hadoop و سناریوهای پردازش داده در دنیای واقعی به دست می‌آورند.

بخش 18: پروژه Hadoop 02 - تحلیل نظرسنجی گردشگری

این بخش با ادامه یادگیری مبتنی بر پروژه‌، بر تحلیل داده نظرسنجی گردشگری با استفاده از فناوری‌های Hadoop تمرکز دارد. دانشجویان روی تسک های مانند محاسبه میانگین هزینه‌کرد گردشگران، تحلیل جمعیت‌شناختی و شناسایی روندهای ترجیحات گردشگری کار می‌کنند. از طریق تمرین‌های عملی و پروژه‌های راهنما، یادگیرندگان مهارت‌های خود را در دستکاری داده، کوئری و مصورسازی برای استخراج بینش‌های ارزشمند برای صنعت گردشگری به کار می‌گیرند.

بخش 19: پروژه Hadoop 03 - مدیریت داده اعضای هیئت علمی

در این پروژه، دانشجویان به تسک مدیریت داده اعضای هیئت علمی در یک مؤسسه آموزشی با استفاده از راهکارهای مبتنی بر Hadoop می‌پردازند. یادگیرندگان روی تسک هایی مانند دریافت داده، طراحی schema، تبدیل داده و کوئری برای ایجاد یک سیستم مدیریت داده جامع برای اعضای هیئت علمی کار می‌کنند. با تکمیل این پروژه، دانشجویان تجربه عملی در طراحی و پیاده‌سازی راهکارهای مدیریت داده با استفاده از فناوری‌های Hadoop به دست می‌آورند.

بخش 20: پروژه Hadoop 04 - تحلیل فروش تجارت الکترونیک

در این پروژه، دانشجویان به بررسی تحلیل داده فروش تجارت الکترونیک با استفاده از ابزارها و تکنیک‌های Hadoop می‌پردازند. آن‌ها روی تسک هایی مانند بخش‌بندی مشتریان، تحلیل عملکرد محصول و پیش‌بینی فروش برای استخراج بینش‌های ارزشمند برای کسب‌وکارهای تجارت الکترونیک کار می‌کنند. با به کارگیری دانش خود از کامپوننت های اکوسیستم Hadoop، تکنیک‌های پردازش داده و متدولوژی تحلیل، دانشجویان تجربه عملی در حل چالش‌های واقعی در حوزه تجارت الکترونیک به دست می‌آورند.

بخش 21: پروژه Hadoop 05 - تحلیل حقوق و دستمزد

این پروژه حول تحلیل داده حقوق و دستمزد با استفاده از رویکردهای مبتنی بر Hadoop می‌چرخد. دانشجویان در تسک هایی مانند شناسایی الگوها در توزیع حقوق، محاسبه میانگین حقوق به تفکیک بخش و تحلیل روندهای جبران خدمات کارمندان شرکت می‌کنند. از طریق تمرین‌های عملی و تسک های تحلیل داده، یادگیرندگان مهارت‌های خود را در دستکاری داده، تحلیل آماری و استخراج بینش‌های عملی از مجموعه‌داده حقوق و دستمزد در مقیاس بزرگ افزایش می‌دهند.

بخش 22: پروژه Hadoop 06 - تحلیل نظرسنجی سلامت با استفاده از HDFS

در این پروژه، دانشجویان تحلیل داده نظرسنجی سلامت را با استفاده از فایل سیستم توزیع‌شده Hadoop (HDFS) و فناوری‌های مرتبط انجام می‌دهند. آن‌ها روی تسک های مانند پیش‌پردازش داده، تحلیل روند و نقشه‌برداری جغرافیایی شاخص‌های سلامت برای کسب بینش در مورد روندها و مسائل سلامت عمومی کار می‌کنند. از طریق پروژه‌های عملی و تسک های مصورسازی داده، یادگیرندگان در استفاده از Hadoop برای تحلیل داده سلامت و تصمیم‌گیری در محیط‌های مراقبت سلامت مهارت پیدا می‌کنند.

بخش 23: پروژه Hadoop 07 - تحلیل تخلفات ترافیکی

در این پروژه، دانشجویان تحلیل داده تخلفات ترافیکی را با استفاده از ابزارها و چارچوب‌های Hadoop بررسی می‌کنند. آن‌ها روی تسک هایی مانند دریافت داده از منابع مختلف، تحلیل مکانی تخلفات ترافیکی و شناسایی الگوها در داده تخلفات رانندگی کار می‌کنند. با اعمال راهکارهای مبتنی بر Hadoop برای تحلیل داده ترافیکی، یادگیرندگان تجربه عملی در درک الگوهای ترافیکی، بهبود ایمنی جاده‌ها و اجرای مداخلات داده‌محور برای مدیریت مؤثر تخلفات ترافیکی به دست می‌آورند.

بخش 24: پروژه Hadoop 08 - یادگیری PIG/MapReduce - تحلیل مجموعه‌داده وام

این پروژه بر تحلیل مجموعه‌داده وام با استفاده از ترکیبی از تکنیک‌های Apache Pig و MapReduce تمرکز دارد. دانشجویان در تسک هایی مانند پیش‌پردازش داده، محاسبه معیارهای ریسک و تولید گزارش‌هایی در مورد عملکرد وام شرکت می‌کنند. از طریق تمرین‌های عملی و تکالیف کدنویسی، یادگیرندگان در استفاده از اسکریپت‌های Pig Latin، پیاده‌سازی الگوریتم‌های MapReduce و انجام تحلیل بر روی مجموعه‌داده وام در مقیاس بزرگ برای پشتیبانی از فرآیندهای تصمیم‌گیری مالی مهارت پیدا می‌کنند.

بخش 25: پروژه Hadoop 09 - HIVE - مطالعه موردی صنعت مخابرات

در این پروژه، دانشجویان به بررسی مطالعه موردی متمرکز بر تحلیل داده صنعت مخابرات با استفاده از Apache Hive می‌پردازند. آن‌ها روی تسک هایی مانند مدل‌سازی داده، بهینه‌سازی پرس‌وجو و تنظیم عملکرد برای استخراج بینش‌های معنادار از مجموعه‌داده مخابراتی کار می‌کنند. از طریق تمرین‌های عملی و کوئری های مبتنی بر SQL در Hive، یادگیرندگان تجربه عملی در انبار داده، هوش تجاری و سیستم‌های پشتیبانی تصمیم متناسب با حوزه مخابرات به دست می‌آورند.

بخش 26: پروژه Hadoop 10 - یادگیری HIVE/MapReduce - تحلیل شکایات مشتریان

این پروژه حول تحلیل داده شکایات مشتریان با استفاده از ترکیبی از تکنیک‌های Hive و MapReduce می‌چرخد. دانشجویان در تسک هایی مانند پیش‌پردازش داده، تحلیل احساسات و شناسایی روند برای درک الگوهای بازخورد مشتریان و بهبود کیفیت خدمات شرکت می‌کنند. با استفاده از Hive برای کوئری داده و MapReduce برای تحلیل‌های پیچیده، یادگیرندگان مهارت‌های ارزشمندی در تحلیل مشتریان و افزایش تجربه مشتری در صنایع مختلف به دست می‌آورند.

بخش 27: پروژه Hadoop 11 - یادگیری HIVE/PIG/MapReduce/Sqoop - تحلیل شبکه‌های اجتماعی

در این پروژه، دانشجویان به تحلیل داده شبکه‌های اجتماعی با استفاده از ترکیبی از ابزارهای اکوسیستم Hadoop از جمله Hive ،Pig ،MapReduce و Sqoop می‌پردازند. آن‌ها روی تسک هایی مانند استخراج داده، تحلیل احساسات و مدل‌سازی رفتار کاربر برای درک روندها و الگوها در تعاملات شبکه‌های اجتماعی کار می‌کنند. از طریق تمرین‌های عملی و تسک های پردازش داده، یادگیرندگان بینش‌هایی در مورد تحلیل شبکه‌های اجتماعی، بهینه‌سازی محتوا و راهبردهای تعامل مخاطب به دست می‌آورند.

بخش 28: پروژه Hadoop 12 - HIVE/PIG - تحلیل داده حسگر

این پروژه بر تحلیل داده حسگر با استفاده از Apache Hive و Pig برای پردازش داده و تحلیل تمرکز دارد. دانشجویان در تسک هایی مانند پاک‌سازی داده، تشخیص ناهنجاری و مدل‌سازی پیش‌بینانه برای استخراج بینش‌های عملی از جریان‌های داده تولیدشده توسط حسگر شرکت می‌کنند. با اعمال راهکارهای مبتنی بر Hadoop برای تحلیل داده حسگر، یادگیرندگان تجربه عملی در تحلیل اینترنت اشیا (IoT) و استفاده از داده حسگر برای اپلیکیشن های مختلف مانند نگهداری پیش‌بینانه و نظارت بر محیط زیست به دست می‌آورند.

بخش 29: پروژه Hadoop 13 - یادگیری PIG/MapReduce - تحلیل داده YouTube

در این پروژه، دانشجویان تحلیل داده YouTube را با استفاده از ترکیبی از Pig و MapReduce انجام می‌دهند. آن‌ها روی تسک هایی مانند پیش‌پردازش داده، شناسایی روند و تحلیل رفتار کاربر برای کشف بینش‌هایی در مورد الگوهای مصرف محتوای YouTube و تعامل مخاطب کار می‌کنند. با استفاده از Pig برای تبدیل داده و MapReduce برای تحلیل‌های پیچیده، یادگیرندگان تجربه عملی در تحلیل کلان‌داده اعمال‌شده بر روی پلتفرم‌های رسانه دیجیتال به دست می‌آورند.

بخش 30: اصول Hadoop و HDFS در Cloudera

این بخش دانش اساسی درباره Hadoop و HDFS (فایل سیستم توزیع‌شده Hadoop) را با استفاده از محیط Cloudera ارائه می‌دهد. دانشجویان در مورد مفاهیم کلان‌داده، ذخیره‌سازی و پردازش توزیع‌شده، همراه با جنبه‌های عملی مانند پیکربندی فراداده و دسترسی به HDFS از طریق رابط‌های مختلف می‌آموزند. از طریق تمرین‌های عملی و بررسی اکوسیستم Hadoop در Cloudera، یادگیرندگان درک محکمی از اصول Hadoop و کاربردهای عملی آن در سناریوهای واقعی به دست می‌آورند.

بخش 31: تحلیل داده لاگ با Hadoop

در این بخش، دانشجویان به بررسی تحلیل داده لاگ با استفاده از ابزارها و تکنیک‌های Hadoop می پردازند. آن‌ها یاد می‌گیرند که چگونه فایل‌های لاگ را به طور کارآمد با استفاده از برنامه‌های MapReduce خلاصه و پردازش کنند و در مورد عملکرد سیستم، رفتار کاربر و حوادث امنیتی بینش کسب کنند. با نوشتن برنامه‌های MapReduce و اجرای آن‌ها روی داده لاگ، یادگیرندگان مهارت‌هایی در تحلیل داده لاگ، عیب‌یابی و بهینه‌سازی سیستم که برای عملیات IT و مدیریت امنیت ضروری است، توسعه می‌دهند.

این دوره برای چه کسانی مناسب است؟

  • تحلیلگران داده که به دنبال ارتقای مهارت‌های خود در فناوری‌های کلان‌داده هستند.
  • مهندسان نرم‌افزار که به انتقال به حوزه کلان‌داده علاقه دارند.
  • متخصصان IT که هدف آن‌ها تخصص در ابزارها و فناوری‌های اکوسیستم Hadoop است.
  • دانشمندان داده که به دنبال استفاده از Hadoop برای پردازش و تحلیل داده در مقیاس بزرگ هستند.
  • متخصصان هوش تجاری (BI) که به استفاده از کلان‌داده برای بینش و تصمیم‌گیری علاقه دارند.
  • فارغ‌التحصیلان و دانشجویانی که آرزوی ساختن حرفه‌ای در کلان‌داده و Hadoop دارند.
  • متخصصان صنایع گوناگون که به دنبال کسب مهارت در تحلیل کلان‌داده هستند.
  • افرادی که به ارتقا یا تغییر مهارت برای مرتبط ماندن در حوزه به‌سرعت در حال تحول علم داده و تحلیل علاقه دارند.

کلان‌ داده: Hadoop - MapReduce - Hive - Pig - NoSQL - Mahout - Oozie

  • مروری بر آموزش Hadoop 02:32
  • مقدمه‌ای بر کلان‌داده و Hadoop 10:41
  • کالبدشناسی نوشتن 06:27
  • ادامه کالبدشناسی نوشتن 05:49
  • کالبدشناسی خواندن 05:59
  • ادامه کالبدشناسی خواندن 06:15
  • شمارش کلمات در Hadoop 11:14
  • اجرای اپلیکیشن Hadoop 04:09
  • ادامه اپلیکیشن Hadoop 04:06
  • کار روی اپلیکیشن نمونه 08:30
  • ایجاد متد Map 08:06
  • مقادیر قابل پیمایش 07:51
  • مسیر خروجی 05:36
  • جعبه Scary Catch 03:03
  • مقدمه‌ای بر مدیریت Hadoop 11:16
  • محدودیت‌های سیستم موجود 11:24
  • ویژگی‌های کلیدی Hadoop 10:14
  • فایل سیستم توزیع‌شده Hadoop 10:05
  • لایه ذخیره‌سازی Hadoop 10:41
  • کامپوننت های اصلی Hadoop 1.0 10:59
  • تصاویر FS 11:12
  • Secondary NameNode 10:48
  • معماری HDFS 11:10
  • سیاست جانمایی بلوک 12:08
  • تکالیف 11:51
  • راه‌اندازی خوشه معماری Hadoop 04:29
  • نصب Hadoop در VMware Workstation 07:50
  • نصب بسته Hadoop 05:03
  • پیکربندی نام میزبان و Gateway 07:28
  • کپی فایل ISO به CentOS 05:32
  • نصب فایل SSH با استفاده از Yum 07:09
  • کپی کلید عمومی به کلید مجاز در SSH 11:57
  • راه اندازی اندازه بلوک و Mapped 05:17
  • ایجاد SSH-keygen برای کاربر HD 07:08
  • شروع MapReduce در Hadoop 05:21
  • ایجاد Clone برای Hadoop 07:20
  • تغییر نام میزبان 11:33
  • پیکربندی Hadoop Site 06:30
  • پیکربندی فایل Slave 06:19
  • ایجاد NameNode و DataNode در Hadoop 07:36
  • آشنایی با HDFS 05:38
  • فایل‌های پیکربندی اصلی Hadoop 06:50
  • خوشه Hadoop و SSH بدون رمز عبور 06:43
  • پیکربندی آگاهی از قفسه 07:38
  • ادامه پیکربندی آگاهی از قفسه 04:55
  • اجرای گزارش مدیریت DFS 05:09
  • Hadoop MapReduce 08:39
  • اجرای NameNode در Hadoop 05:01
  • اجرای فرمان Hadoop 07:35
  • نوشتن فایل در خوشه Hadoop 05:43
  • آشنایی با فرمان FS 08:48
  • دایرکتوری‌های داده 04:59
  • بررسی فایل سیستم 07:25
  • نوشتن داده در HDFS 06:17
  • گره Checkpointing 06:38
  • ادغام فراداده 06:43
  • خوشه در حالت ایمن 07:08
  • خوشه در حالت نگهداری 07:08
  • راه‌اندازی DataNodeها 07:50
  • NameNode 05:35
  • اعتبارسنجی DataNode 06:56
  • ملاحظات ذخیره‌سازی 06:33
  • مرتب‌سازی ثانویه در Hadoop 08:42
  • ایجاد کلید ترکیبی 08:29
  • ادامه کلید ترکیبی 09:19
  • گروه شمارش کلمات 06:32
  • اهمیت پارتیشن 11:16
  • Hadoop FS - LS 04:55
  • Joinها در Hadoop 07:28
  • ایجاد آبجکت Configuration 06:20
  • متد Setup 07:19
  • Mapper برای Map Side Join 07:50
  • فرمان های Hadoop 06:43
  • Combiner در Hadoop 06:10
  • ادامه Combiner در Hadoop 08:57
  • بارگذاری Jar مربوط به Combiner 04:27
  • مقدمه‌ای بر دنیای واقعی 10:08
  • Mapper امتیازها 07:26
  • اجرای فیلم و امتیازها 08:47
  • Jar محاسبه فیلم و امتیاز 04:09
  • مجموع امتیازهای یک کاربر 08:15
  • Reducer امتیازدهی کاربر 11:19
  • کلاس امتیازدهی کاربر 04:57
  • آموزش اولیه YARN 10:04
  • Node Manager 09:35
  • اجرای یک برنامه MapReduce 12:09
  • ادامه اجرای یک برنامه MapReduce 11:03
  • فایل سیستم HDFS 10:02
  • ترکیب قابلیت شمارش کلمات 09:29
  • شمارش کلمات با ابزارها 10:27
  • پردازشگر لاگ 11:07
  • MapReduce پیشرفته و PIG 10:11
  • بیشتر درباره MapReduce پیشرفته 08:56
  • اجرای برنامه مشابه 08:29
  • داده HDI و اکسپورت کردن داده 12:41
  • ایجاد کلاس جدید Java 12:00
  • Text Out Inverted Indexer 12:52
  • مقدمه‌ای بر MapReduce در Hadoop 09:52
  • مسیر ساخت Java 10:11
  • MapReduce محلی 04:29
  • استفاده از MapReduce 08:54
  • فرمت Sequence File 11:17
  • تجزیه وبلاگ‌ها 10:43
  • Page View Mapper 09:25
  • برنامه تحلیلی 08:52
  • ادامه برنامه تحلیلی 11:51
  • ایندکس معکوس در MapReduce 11:24
  • Friend Sofa Friend 07:39
  • میزبان محلی Cloudera 07:28
  • خروجی میزبان محلی Cloudera 10:42
  • برنامه نهایی ماژول MapReduce 11:06
  • Strands 09:20
  • فیلتر مسیر فایل 09:14
  • مثال 08:57
  • ادامه مثال 09:30
  • مقدمه‌ای بر HIVE 10:45
  • پایگاه داده HIVE 10:21
  • فرمان Load Data 05:37
  • چگونگی جایگزینی ستون 04:17
  • جدول خارجی 06:26
  • HIVE Metastore 03:25
  • پارتیشن Hive چیست؟ 07:29
  • ایجاد جدول پارتیشن‌شده 08:30
  • Insert Overwrite Table 03:55
  • پارتیشن پویا True 01:57
  • Bucketing در Hive 05:24
  • تجزیه مجموعه‌داده 05:30
  • Joinها در Hive 08:51
  • ادامه Joinها در Hive 09:45
  • Skew Join 02:54
  • Serde چیست؟ 07:29
  • Serde در Hive 08:55
  • UDF در Hive 09:46
  • ادامه UDF در Hive 07:28
  • UDFهای بیشتر در Hive 06:58
  • تابع Maxscale 03:01
  • نمونه کاربرد Hive 12:04
  • مقدمه‌ای بر مفاهیم Hive و نمایش عملی 05:59
  • جدول داخلی و جدول خارجی 06:19
  • درج داده در جدول‌ها 07:25
  • توابع تاریخ و ریاضی 09:00
  • دستورات شرطی 06:40
  • Explode و Lateral View 07:59
  • مرتب‌سازی 06:18
  • Join 08:44
  • Map Join 02:10
  • پارتیشن‌بندی ایستا و پویا 07:17
  • بیشتر درباره پارتیشن‌بندی پویا 06:59
  • فرمان Alter 06:15
  • فرمان MSCK 08:44
  • Bucketing 08:08
  • نمونه‌برداری از جدول 03:05
  • بایگانی 02:44
  • رتبه‌ها 08:44
  • ایجاد viewها 08:39
  • مزایای viewها و تغییر viewها 06:50
  • ایندکس‌گذاری چیست؟ Processing..
  • زمان اجرای Compact و Bitmap Index 05:25
  • فرمان های Hive در Bash Shell 05:24
  • متغیرهای Hive - Hiveconf 04:10
  • متغیرهای Hive - Hiveconf در Bash Shell 05:08
  • پیکربندی متغیر Hive Var 08:57
  • جایگزینی متغیر 02:14
  • شمارش کلمات 05:47
  • معماری Hive 03:14
  • موازی‌سازی در Hive 06:14
  • ویژگی‌های جدول در Hive 06:06
  • ویژگی‌های قالب Null 05:31
  • ادامه ویژگی‌های قالب Null 03:39
  • فرمان های Purge در Hive 04:41
  • Slowly Changing Dimension 06:56
  • پیاده‌سازی SCD 08:57
  • نمونه‌ای از SCD 04:02
  • چگونگی بارگذاری داده XML در Hive 05:11
  • ادامه چگونگی بارگذاری داده XML در Hive 08:48
  • No Drop و Offline در Hive 08:09
  • جدول غیرقابل‌تغییر 09:09
  • چگونگی ایجاد فایل RC در Hive 08:38
  • چندین جدول 06:25
  • ادغام فایل‌های ایجادشده توسط Hive و تابع rLike 05:32
  • تنظیمات مختلف پیکربندی در Hive 09:07
  • ادامه تنظیمات مختلف پیکربندی در Hive 03:12
  • فشرده‌سازی فایل‌های مختلف در Hive 05:45
  • حالت‌های مختلف در Hive 03:54
  • فشرده‌سازی فایل در Hive 05:30
  • انواع حالت در Hive 03:56
  • مقایسه جدول داخلی و خارجی 08:19
  • مقدمه‌ای بر Pig 04:56
  • ویژگی‌های Apache Pig 08:08
  • مقایسه Pig و Hive 10:10
  • حالت‌های محلی و MR در Apache Pig 04:30
  • اجرای حالت‌های محلی 05:59
  • انواع داده در Pig 08:58
  • فرمان های Pig - Store و Load 08:38
  • فرمان Load 06:02
  • فرمان های Pig - Group 06:12
  • عملگر CoGroup 06:19
  • عملگرهای Join و Cross در Pig 07:24
  • ادامه عملگرهای Join و Cross در Pig 07:19
  • عملگرهای Union و Split در Pig 05:19
  • بیشتر درباره عملگرهای Split 07:41
  • Filter ،Distinct و For Each 10:47
  • توابع Pig 04:32
  • ادامه توابع Pig 08:10
  • اندازه داده ورودی 07:39
  • شروع کار با PIG 04:58
  • فرایند نصب 10:09
  • Pig Latin 07:32
  • بارگذاری فایل در HDFS 10:25
  • اسکریپت PIG 10:02
  • مبانی Pig Latin 07:31
  • راه‌اندازی و کار با Pig 08:20
  • بارگذاری و ذخیره‌سازی 07:23
  • ادامه بارگذاری و ذخیره‌سازی 08:07
  • اشکال‌زدایی 10:35
  • Grunt Shell 08:27
  • UDFها و Piggy Bank 10:45
  • تاریخچه‌ای کوتاه از NoSQL 08:40
  • مستقل از Schema 06:55
  • غیررابطه‌ای 06:01
  • NoSQL سازمانی 09:17
  • روندهای اخیر در فناوری اطلاعات 07:36
  • مزایا و ملاحظات NoSQL 09:34
  • مدیریت انواع مختلف داده 07:43
  • Triple Store و Graph Store 08:05
  • پایگاه‌های داده ترکیبی NoSQL 07:53
  • اعمال متد سازگاری 07:08
  • انتخاب ACID یا BASE؟ 09:49
  • توسعه برنامه روی NoSQL 04:58
  • معناشناسی 08:39
  • ابر عمومی 07:05
  • مدیریت دسترس‌پذیری 06:25
  • نسخه‌بندی داده 06:25
  • Mahout چیست> 06:44
  • معماری Mahout 08:26
  • نصب Subversion 06:44
  • توصیه‌گری مبتنی بر آیتم 07:15
  • مثال - طبقه‌بند CBayes 08:19
  • گزینه‌های خط فرمان 10:40
  • خوشه‌بندی Canopy 10:52
  • توصیه‌گر اولیه 10:38
  • مثال‌های عملی 08:19
  • فرمان Mahout Seqdumper 06:44
  • اجرای کد از طریق Eclipse 06:27
  • خواندن از روی کد 06:17
  • مقدمه‌ای بر بررسی عمیق Apache Mahout 09:22
  • موارد استفاده 09:09
  • توصیه‌گری 11:00
  • مثال - فاصله Tanimoto 07:08
  • چگونه از Mahout استفاده کنیم؟ 09:42
  • تمرین 07:05
  • مثال - ارزیابی 07:13
  • بررسی عمیق خوشه‌بندی Canopy 10:15
  • طبقه‌بندی 10:18
  • فایل برداری 08:10
  • طبقه‌بند Naïve Bayes از روی کد 11:27
  • خوشه‌بندی KMeans 05:51
  • رگرسیون لجستیک 08:17
  • مقدمه‌ای بر Apache Oozie 08:30
  • بررسی دقیق Action 09:28
  • بررسی پارامترها 09:03
  • Email Action در Oozie 04:53
  • Hadoop FS Action در Oozie 05:01
  • Hive Action در Oozie 09:43
  • ادامه Hive Action در Oozie 05:01
  • گره کنترلی 02:47
  • ادامه گره کنترلی 06:30
  • Pig Action در Oozie 09:38
  • ادامه Pig Action در Oozie 08:48
  • هماهنگ‌کننده‌های Oozie 12:26
  • اپلیکیشن های گردش‌کار Oozie 08:31
  • ادامه اپلیکیشن های گردش‌کار Oozie 11:14
  • مقدمه‌ای بر Flume 11:09
  • جریان داده در Flume 05:26
  • مثال Netcat در Flume 03:58
  • مقدمه 01:56
  • توضیح Hadoop 04:13
  • مقدمه‌ای بر Storm 04:09
  • تاریخچه Apache Storm 03:44
  • ویژگی‌های Apache Storm 03:04
  • معماری Apache Storm 03:13
  • توضیح معماری به‌صورت دقیق 07:23
  • توپولوژی 05:25
  • Spoutها و Boltها 03:38
  • جریان 03:01
  • فرآیند نصب 02:10
  • گروه‌بندی جریان 10:45
  • ادامه گروه‌بندی جریان 04:51
  • قابلیت اطمینان 05:24
  • تسک ها 03:26
  • کارگرها 03:20
  • نصب Java و Zookeeper 08:38
  • نصب Zookeeper 08:44
  • نصب Eclipse 01:41
  • کلاینت خط فرمان 03:59
  • موازی‌سازی در توپولوژی Storm 07:43
  • مقدمه‌ای بر Apache Avro 11:06
  • استفاده از Avro با Sqoop 11:46
  • انواع داده اولیه پشتیبانی‌شده در Avro 04:04
  • مقدمه‌ای بر Apache Spark 07:12
  • Spark Context 06:06
  • کامپوننت های Spark 05:51
  • مقدمه‌ای بر مبانی RDD در Spark 11:23
  • استفاده از تابع Filter 09:10
  • تبدیل‌های RDD در Spark 07:40
  • ادامه تبدیل‌های RDD در Spark 07:12
  • ماندگاری RDD در Spark 09:47
  • Group Sort و عملیات روی Pair RDDها 07:09
  • فرمت‌های فایل Spark 10:13
  • ادامه فرمت‌های فایل Spark 02:16
  • مقدمه‌ای بر اتصال به Twitter با استفاده از Spark 09:13
  • نمودار جریان Spark 06:13
  • کامپوننت های Spark 07:59
  • سرویس‌های مختلف در حال اجرا روی YARN 08:11
  • مقدمه‌ای بر Scala 06:13
  • کلاس‌های Case و تطابق الگو 07:02
  • نصب Scala 07:22
  • متغیرها و توابع 06:42
  • ادامه متغیرها و توابع 05:20
  • حلقه‌ها 11:52
  • مجموعه‌ها 10:46
  • بیشتر درباره مجموعه‌ها 07:44
  • کلاس انتزاعی 08:27
  • مثال از کلاس انتزاعی 04:01
  • Trait 06:10
  • مثال از Trait 05:46
  • استثنا 06:09
  • مثال عملی از استثناها 06:47
  • سفارشی‌سازی استثناهای پروژه Scala 09:04
  • تغییردهنده‌ها 10:33
  • رشته‌ها 11:01
  • متدها در رشته‌ها 09:38
  • ادامه متدها در رشته‌ها 05:56
  • آرایه 10:17
  • RDD در Spark 06:41
  • ادامه RDD در Spark 07:13
  • عملیات مختلف 11:58
  • عملیات تبدیل 11:40
  • عملیات Action 06:50
  • ادامه عملیات Action 05:05
  • مقدمه‌ای بر Spark Streaming 07:30
  • چگونگی پردازش داده‌های پخش زنده 07:10
  • ادامه چگونگی پردازش داده‌های پخش زنده 05:58
  • شمارش کلمات پنجره‌ای 06:32
  • مثال شمارش کلمات پنجره‌ای 07:10
  • Check Pointing در Spark 08:48
  • مثال Check Pointing در Spark 08:32
  • ایجاد Maven 10:40
  • ایجاد پروژه Scala 06:55
  • تفاوت بین Hadoop 1.x و 2.x 04:20
  • اتصال به Twitter با استفاده از Spark Streaming 09:13
  • چگونگی اتصال به Twitter با استفاده از اپلیکیشن Spark 03:54
  • بیشتر درباره اتصال به Twitter با استفاده از اپلیکیشن Spark 09:40
  • مقدمه‌ای بر تحلیل داده‌ فروش با استفاده از Hadoop-HDFS 10:07
  • کار با صورت مسئله 2 07:52
  • کار با صورت مسئله 3 07:50
  • کار با صورت مسئله 4 09:06
  • کار با صورت مسئله 5 07:01
  • کار با صورت مسئله 6 05:47
  • مقدمه‌ای بر تحلیل نظرسنجی گردشگری با استفاده از HDFS 09:34
  • میانگین پول خرج‌شده توسط گردشگران در کشور ما 06:48
  • ادغام کشور و ملیت 07:42
  • تعداد کل گردشگران کمتر از 18 سال 07:18
  • تغییر ستون نام کشور 06:12
  • تعداد مردان از استرالیا 07:12
  • جزئیات کلی نظرسنجی گردشگری و جزئیات هزینه 10:10
  • مقدمه‌ای بر مدیریت داده‌ اعضای هیئت علمی با استفاده از HDFS 06:55
  • صنعت آموزش 06:03
  • افزودن ستون جدید در مدیریت پایگاه داده اعضای هیئت علمی 07:41
  • تغییر نام ستون و نوع داده 06:39
  • حذف ستون از جدول و افزودن ستون جدید 08:36
  • مقدمه‌ای بر تحلیل فروش تجارت الکترونیک با Hadoop 06:24
  • جزئیات مشتری خارج از ایالات متحده 08:29
  • جزئیات مشتری با حساب ایجادشده پس از 2009 08:36
  • جزئیات مشتریانی که فروش آن‌ها کمتر از 3600 دلار است 06:38
  • جزئیات مشتری با نام Anushka 06:16
  • کارمند پاره‌وقت با استفاده از تحلیل حقوق 07:01
  • جزئیات کمک اداری 06:29
  • مجموعه‌داده‌ به ترتیب صعودی 07:16
  • عنوان شغلی برای هر بخش 07:34
  • تغییر نام به نام کارمند 06:40
  • تعداد کل کارکنان ساعتی 06:43
  • حقوق سالانه دریافت‌شده توسط بخش مالی 08:04
  • مقدمه‌ای بر تحلیل سلامت 10:41
  • نمایش داده ردیف‌ها از جدول داده سلامت 07:30
  • افزودن داده جدید به جدول داده سلامت 08:11
  • دریافت داده از پایگاه داده HDFS از پایگاه داده SQL 05:59
  • دریافت داده در دایرکتوری جدید HDFS از SQL 08:10
  • اکسپورت کردن جدول داده از HDFS به SQL 09:31
  • دریافت جزئیات جمعیت شهر در مجموعه‌داده سلامت 07:29
  • مقدمه‌ای بر تحلیل تخلفات ترافیکی 08:58
  • ادامه مقدمه‌ای بر تحلیل تخلفات ترافیکی 07:28
  • دریافت جدول از SQL به دایرکتوری HDFS 04:39
  • خروجی جدول از SQL به دایرکتوری HDFS 08:12
  • فهرست پایگاه‌های داده و جدول‌های SQL در HDFS 09:46
  • ایجاد و اجرای jobها در تخلفات ترافیکی 09:58
  • ایمپورت کردن داده‌ آسیب‌های شخصی از SQL 09:11
  • دریافت داده برای ایالت مریلند 08:34
  • استخراج داده‌های تخلفات ترافیکی از HDFS به MySQL 10:02
  • مقدمه‌ای بر تحلیل مجموعه‌داده وام 07:11
  • ادامه مقدمه‌ای بر تحلیل مجموعه‌داده وام 07:58
  • میانگین کلی ریسک 07:30
  • کدنویسی میانگین ریسک 08:06
  • ادامه کدنویسی میانگین ریسک 06:34
  • بیشتر درباره میانگین ریسک 08:16
  • میانگین ریسک به تفکیک مکان 07:01
  • میانگین ریسک به تفکیک نوع وام 10:17
  • محاسبه میانگین ریسک به تفکیک دسته 06:29
  • ادامه محاسبه میانگین ریسک به تفکیک دسته 04:43
  • رابط Comparable در MapReduce 09:32
  • پیاده‌سازی و اجرای MapReduce 06:34
  • میانگین ریسک به تفکیک دسته در PIG 07:53
  • میانگین ریسک به تفکیک دسته و مکان در PIG 07:33
  • ادامه میانگین ریسک به تفکیک دسته و مکان در PIG 06:23
  • میانگین ریسک به تفکیک دسته در Hive 07:03
  • تحلیل مجموعه‌داده وام بانکی در HIVE 06:57
  • ادامه تحلیل مجموعه‌داده وام بانکی در HIVE 05:42
  • آشنایی با Sqoop و دریافت داده RDBMS در HDFS 10:44
  • مقدمه‌ای بر Hive 07:48
  • انواع داده ساده و پیچیده در Hive 08:48
  • خوشه‌ها 00:29
  • فرمان پایگاه داده در Hive 11:51
  • فرمان های جدول در Hive 05:39
  • مدیریت جدول‌ها 06:29
  • جدول‌های خارجی 01:31
  • مقدمه‌ای بر پارتیشن‌بندی 07:08
  • فرمان پارتیشن 06:55
  • Bucketing 08:01
  • جدول Contr Services در Hive 11:06
  • مثال از Contr Services 06:36
  • ادامه مثال از Contr Services 05:04
  • ایجاد جدول Contract All 10:42
  • مقدمه‌ای بر پروژه شکایات مشتریان در کلان‌داده 11:34
  • شکایت ثبت‌شده زیر هر فایل 09:57
  • ایجاد فایل‌های راه‌انداز و مانیفست Jar 10:21
  • ادامه ایجاد فایل‌های راه‌انداز و مانیفست Jar 02:05
  • شکایت ثبت‌شده از یک مکان خاص 05:34
  • مکان تعریف‌شده توسط کاربر 07:35
  • فهرست شکایات گروه‌بندی‌شده بر اساس مکان 06:09
  • مقدمه‌ای بر صنعت رسانه‌های اجتماعی 08:35
  • وب‌سایت نشانه‌گذاری 07:39
  • ادامه وب‌سایت نشانه‌گذاری 05:19
  • آشنایی با Sqoop 07:22
  • انتقال داده از RDBMS به HDFS 08:51
  • اجرای برنامه MapReduce برای پردازش فایل XML 12:06
  • تحلیل عملکرد کتاب بر اساس نظرات با استفاده از کد 07:07
  • ادامه تحلیل عملکرد کتاب بر اساس نظرات با استفاده از کد 08:48
  • تحلیل کتاب بر اساس مکان 07:24
  • مثال تحلیل کتاب بر اساس مکان 06:50
  • تحلیل خواننده کتاب در برابر نویسنده 10:22
  • چگونگی پردازش فایل XML در PIG 06:25
  • ادامه چگونگی پردازش فایل XML در PIG 08:06
  • تحلیل عملکرد کتاب در فایل XML در PIG 10:04
  • بیشتر درباره تحلیل عملکرد کتاب در فایل XML در PIG 10:04
  • خروجی فایل XML در Pig با استفاده از کتاب 09:28
  • خروجی فایل XML در Pig با استفاده از مکان 09:32
  • ادامه خروجی فایل XML در Pig با استفاده از مکان 08:36
  • آشنایی با مجموعه‌داده پیچیده با استفاده از Hive 11:37
  • ادامه آشنایی با مجموعه‌داده پیچیده با استفاده از Hive 09:40
  • ایجاد آرایه در MapReduce با استفاده از Hive 09:59
  • مجموعه‌داده نوع نشانه‌گذاری با استفاده از نوع پیچیده 08:31
  • خروجی مجموعه‌داده نوع نشانه‌گذاری 09:46
  • مقدمه‌ای بر تحلیل داده‌های حسگر 07:26
  • ادامه مقدمه‌ای بر تحلیل داده‌ حسگر 10:20
  • مثال تحلیل داده‌ حسگر 10:46
  • آشنایی با مبانی کلان‌داده و MapReduce 08:08
  • بیشتر درباره کلان‌داده و MapReduce 10:30
  • تبدیل فایل JSON به قالب متن ساده 07:55
  • ادامه تبدیل فایل JSON به قالب متن ساده 06:33
  • خروجی برای قالب فایل JSON 04:29
  • تفاوت بین Pig، MapReduce و Hive 09:55
  • بیشتر درباره Pig، MapReduce و Hive 07:22
  • پردازش داده‌های حسگر در Pig 10:34
  • کار با تابع Pig 08:10
  • انواع تابع در Pig 08:24
  • مثال تابع Pig 08:03
  • کار روی کاربردها با استفاده از توابع در PIG 08:59
  • جریان داده کاربرد در Pig 06:51
  • جریان داده نسبت در Pig 08:11
  • بیشتر درباره کاربردها در Pig 09:17
  • ادامه بیشتر درباره کاربردها در Pig 08:57
  • مثال نسبت آموزش در Pig 08:34
  • رویکرد پردازش فایل JSON در Hive 10:30
  • ویژگی‌ها و پرس‌وجو در Hive 10:30
  • کار روی کاربردهای JSON با Hive 07:10
  • ادامه کار روی کاربردهای JSON با Hive 06:11
  • خروجی کاربردهای JSON با Hive 11:01
  • بیشتر درباره کاربردهای JSON در Hive 10:11
  • خلاصه پردازش داده‌های حسگر 09:26
  • مقدمه‌ای بر تحلیل داده‌ YouTube با Hadoop 07:01
  • ادامه مقدمه‌ای بر تحلیل داده‌ YouTube با Hadoop 07:45
  • آماده‌سازی داده برای تحلیل داده‌ YouTube با Hadoop 08:23
  • مبانی کلان‌داده و MapReduce 10:21
  • بیشتر درباره کلان‌داده و MapReduce 06:32
  • کار با سناریوی تحلیل با استفاده از MapReduce 10:01
  • مثال تحلیل‌گر YouTube با MapReduce 08:51
  • خروجی تحلیل YouTube در MapReduce 06:31
  • تحلیل‌گر ویدیوهای YouTube با امتیاز بالا در MapReduce 12:12
  • پیاده‌سازی و خروجی در MapReduce 09:39
  • مبانی PIG 10:18
  • ادامه مبانی PIG 07:25
  • تحلیل داده‌ YouTube با پیاده‌سازی PIG 10:11
  • مثال پیاده‌سازی PIG 12:07
  • خروجی پیاده‌سازی PIG 09:17
  • تحلیل‌گر ویدیوهای YouTube با Hive 07:24
  • ایجاد تحلیل‌گر ویدیوهای YouTube با Hive 07:41
  • تحلیل ویدیوهای YouTube با کوئری Hive 06:49
  • ادامه تحلیل ویدیوهای YouTube با کوئری Hive 06:18
  • بیشتر درباره زبان‌های کوئری Hive 07:58
  • نتیجه‌گیری 11:17
  • کلان‌داده چیست؟ 03:51
  • پردازش کلان‌داده 08:36
  • ذخیره‌سازی و پردازش توزیع‌شده 07:53
  • آشنایی با MapReduce 05:00
  • مقدمه‌ای بر ماژول 2 01:59
  • مقدمه‌ای بر محیط Cloudera 04:43
  • آشنایی با محیط Hadoop نصب‌شده روی Cloudera 05:25
  • آشنایی با پیکربندی فراداده در Hadoop 05:02
  • آشنایی با رابط وب HDFS و HUE 06:21
  • فرمان های شل HDFS 08:43
  • چند فرمان دیگر HDFS در شل 07:25
  • دسترسی به HDFS از طریق برنامه Java 10:34
  • مقدمه‌ای بر پردازش لاگ 08:07
  • خلاصه‌سازی فایل‌های لاگ 08:07
  • برنامه MapReduce 09:29
  • اجرای برنامه MapReduce 09:21
  • فناوری کلان‌داده 10:23
  • اجرای ابزار کلان‌داده 10:17
  • نوشتن برنامه MapReduce 07:23
  • جستجو در ArrayList 06:30
  • پردازش فایل‌ها در MapReduce 05:31
  • جمع‌بندی 07:06

40,499,200 10,124,800 تومان

مشخصات آموزش

کلان‌ داده: Hadoop - MapReduce - Hive - Pig - NoSQL - Mahout - Oozie

  • تاریخ به روز رسانی: 1405/04/02
  • سطح دوره:Alls
  • تعداد درس:532
  • مدت زمان :67:57:08
  • حجم :46.94GB
  • زبان:دوبله زبان فارسی
  • دوره آموزشی:AI Academy

آموزش های مرتبط

The Great Courses
2,260,000 452,000 تومان
  • زمان: 03:02:02
  • تعداد درس: 14
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
795,000 159,000 تومان
  • زمان: 58:00
  • تعداد درس: 12
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
19,403,000 3,880,600 تومان
  • زمان: 26:02:40
  • تعداد درس: 175
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
8,508,000 1,701,600 تومان
  • زمان: 11:25:13
  • تعداد درس: 94
  • سطح دوره:
  • زبان: دوبله فارسی
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
1,833,000 366,600 تومان
  • زمان: 02:27:39
  • تعداد درس: 24
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
6,100,500 1,220,100 تومان
  • زمان: 08:11:21
  • تعداد درس: 28
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
7,256,500 1,451,300 تومان
  • زمان: 09:44:25
  • تعداد درس: 67
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
3,634,500 726,900 تومان
  • زمان: 04:52:43
  • تعداد درس: 38
  • سطح دوره:
  • زبان: دوبله فارسی

آیا سوالی دارید؟

ما به شما کمک خواهیم کرد تا شغل و رشد خود را افزایش دهید.
امروز با ما تماس بگیرید