دوره آموزشی
The Great Courses
دوبله زبان فارسی

تسلط به بینایی کامپیوتری - از پیکسل تا تشخیص تا Gen-CV

تسلط به بینایی کامپیوتری - از پیکسل تا تشخیص تا Gen-CV

✅ سرفصل و جزئیات آموزش

آنچه یاد خواهید گرفت:

  • تسلط به اصول بینایی کامپیوتری: درک می‌کنید که رایانه‌ها چگونه داده‌ ویژوال را پردازش و تفسیر می‌کنند؛ از دستکاری پیکسل‌ها و فضاهای رنگی تا فیلترینگ پیشرفته
  • ساخت و استقرار مدل‌های یادگیری عمیق: شبکه‌های عصبی کانولوشن (CNN) را با استفاده از TensorFlow و PyTorch طراحی، آموزش و بهینه‌ می‌کنید، از جمله معماری‌های پیشرفته
  • پیاده‌سازی سامانه‌های تشخیص آبجکت پیشرفته: با استفاده از YOLO و R-CNN سریع‌تر و DETR و اپلیکیشن‌های تشخیص آبجکت آماده‌ تولید می‌سازید که بتوانند شناسایی کنند.
  • ایجاد مدل‌های پیشرفته‌ بخش‌بندی و مولد: سیستم‌های بخش‌بندی سمانتیک و نمونه‌ را با U-Net و Mask R-CNN می‌سازید و اپلیکیشن‌های generative AI ایجاد می‌کنید.
  • اعمال تکنیک‌های یادگیری انتقالی و فاین تیونینگ: از مدل‌های از پیش‌ آموزش‌ دیده روی ImageNet و سایر مجموعه‌ داده‌های بزرگ برای حل مؤثر مسائل بینایی کامپیوتری سفارشی بهره می‌گیرید.
  • توسعه‌ پورتفولیوی حرفه‌ای: بیش از 7 پروژه‌ مرتبط با صنعت را تکمیل می‌کنید، از جمله classifiers تصویر، آشکارسازهای آبجکت بلادرنگ و ابزارهای حذف پس‌زمینه 
  • درک نظریه و ریاضیات پشت یادگیری عمیق: اصول ریاضی پشت شبکه‌های عصبی را درک می‌کنید، از جمله پس‌انتشار، نزول گرادیان و توابع ضرر 
  • تسلط به ابزارها و چارچوب‌های استاندارد صنعت: کسب مهارت در TensorFlow و PyTorch و OpenCV و scikit-image و شیوه‌های مدرن MLOps برای استقرار مدل
  • آمادگی برای مصاحبه‌های مهندسی بینایی کامپیوتری: با اطمینان درباره‌ معماری‌هایی مانند اتصالات باقیمانده‌ ResNet، تشخیص تک‌مرحله‌ای YOLO بحث می‌کنید.
  • استقرار مدل‌ها در تولید: بهترین شیوه‌ها برای بهینه‌سازی مدل، کوانتیزاسیون، پایپ‌لاین‌های استقرار و ارائه‌ مدل‌های بینایی کامپیوتری در کاربردهای واقعی را می‌آموزید.

پیش‌نیازهای دوره

  • برای بهره‌ بردن حداکثری از دوره، باید درک خوبی از برنامه‌نویسی اولیه‌ پایتون داشته باشید؛ از جمله متغیرها، حلقه‌ها، توابع و شرطی‌ها و همچنین با Jupyter Notebooks یا IDE دلخواه پایتون خود آشنا باشید.
  • هر چند آشنایی پایه با ریاضیات به‌ ویژه جبر و مفاهیم اولیه‌ حسابان مفید است، اما الزامی نیست.
  • از نظر سخت‌افزاری، به یک رایانه با حداقل 8GB RAM و دسترسی مدیریتی برای نصب پکیج‌های پایتون نیاز دارید.
  • مهم‌تر از همه، هیچ تجربه‌ قبلی در یادگیری ماشین، یادگیری عمیق یا بینایی کامپیوتری لازم نیست، زیرا همه‌ موارد را از ابتدا شروع می‌کنیم
  • تنها چیزی که نیاز دارید اشتیاق به یادگیری و تمایل به ورود به پروژه‌های کدنویسی عملی است.

توضیحات دوره

تسلط به بینایی کامپیوتری: از پیکسل تا تشخیص تا Gen-CV

در 34 ساعت، از یک یادگیرنده‌ کنجکاو به یک مهندس بینایی کامپیوتری مطمئن تبدیل شوید.

آیا آماده‌اید فناوری‌ را بسازید که جهان ویژوال ما را شکل می‌دهد؟

بینایی کامپیوتری فقط آینده نیست همین حالا در جریان است. ماشین‌های خودران در خیابان‌ها ناوبری می‌کنند. اپلیکیشن‌ها چهره‌ شما را تشخیص می‌دهند. هوش مصنوعی آثار هنری خیره‌کننده خلق می‌کند. پشت هر نوآوری ویژوال، فناوری بینایی کامپیوتری قرار دارد و تقاضا برای مهندسان ماهر بینایی کامپیوتری هرگز تا این اندازه بالا نبوده است. شرکت‌هایی مانند گوگل، Tesla و Meta و بی‌شمار استارتاپ دیگر به‌ شدت به دنبال متخصصانی هستند که بتوانند سامانه‌های بینایی را بسازند، مستقر و بهینه‌سازی کنند.

اما چالش اینجاست: بیشتر دوره‌ها یا شما را در نظریه غرق می‌کنند بدون اینکه کاربرد عملی ارائه دهند، یا شما را بدون ایجاد دانش پایه‌ای لازم، مستقیم وارد چارچوب‌های یادگیری عمیق می‌کنند؛ در حالی که برای موفقیت واقعی به آن پایه نیاز دارید.

این دوره متفاوت است.

«تسلط به بینایی کامپیوتری - از پیکسل تا تشخیص تا Gen-CV» مسیر کامل را ارائه می‌دهد از درک اینکه رایانه‌ها چگونه پیکسل‌های جداگانه را پردازش می‌کنند تا استقرار مدل‌های generative AI پیشرفته

چه دانشجویی باشید که می‌خواهد متمایز شود، چه یک فرد حرفه‌ای‌ که مسیر شغلی خود را تغییر می‌دهد، چه پژوهشگری که به مهارت‌های پیاده‌سازی نیاز دارد، یا کارآفرینی که محصولی مبتنی بر بینایی می‌سازد، این مسیر جامع شما را از صفر تا آمادگی برای استقرار پیش می‌برد.

آنچه دوره را منحصربه‌فرد می‌کند؟

معماری یادگیری تدریجی: ما هیچ مرحله‌ای را حذف نمی‌کنیم. شما با پردازش کلاسیک تصویر و مبانی OpenCV شروع می‌کنید و شهود لازم برای درک این‌که رایانه‌ها واقعاً چگونه «می‌بینند» را می‌سازید. شما سپس شبکه‌های عصبی کانولوشن را به‌ طور کامل یاد می‌گیرید؛ نه فقط اینکه چگونه از آنها استفاده کنید، بلکه چرا کار می‌کنند. در نهایت، معماری‌های پیشرفته‌ مانند ترنسفرمرهای بینایی، DETR و SAM را بررسی می‌کنید همان مدل‌هایی که امروز پشت پیشرفت‌های هوش مصنوعی قرار دارند.

34 ساعت تمرین عملی: هر مفهوم با کد نمایش داده می‌شود. هر ماژول شامل پروژه‌های عملی است. شما فقط ویدئو تماشا نمی‌کنید بلکه با TensorFlow و PyTorch و فریمورک‌های استاندارد صنعت، اپلیکیشن‌های واقعی می‌سازید.

بیش از 7 پروژه‌ آماده برای پورتفولیو: در پایان دوره، یک CNN برای دسته‌بندی مد با دقت بیش از %92، یک آشکارساز آبجکت YOLO بلادرنگ با سرعت 45+ FPS، یک سیستم حذف پس‌زمینه مبتنی بر U-Net، یک اپلیکیشن انتقال سبک تصویر، یک سامانه‌ تشخیص چهره با شناسایی نقاط کلیدی، یک ابزار بخش‌بندی نمونه‌ Mask R-CNN، و مدل‌های سفارشی آموزش‌ دیده از پایه و مستقر شده در تولید را ساخته‌اید.

آمادگی برای مصاحبه داخلی: با اطمینان درباره‌ اتصالات باقیمانده‌ ResNet، نوآوری‌های معماری YOLO، اتصالات میانبر U-Net و مکانیسم توجه (attention) در ترنسفرمرهای بینایی صحبت خواهیم کرد. هر معماری با شفافیت توضیح داده می‌شود تا بتوانید در مصاحبه‌های فنی، «دلیل» پشت «چگونگی» را بیان کنید.

مخاطبان دوره:

این دوره برای گروه‌های مختلف از جمله دانشجویانی که به دنبال مهارت‌های تخصصی هوش مصنوعی هستند تا در بازار کار رقابتی برجسته شوند، توسعه‌دهندگان نرم‌افزار که می‌خواهند بینایی کامپیوتری را به ابزار حرفه‌ای خود اضافه کنند، افرادی که مسیر شغلی خود را تغییر می‌دهند و به نقش‌های پردرآمد مهندسی هوش مصنوعی وارد می‌شوند، پژوهشگرانی که برای پروژه‌های هوش مصنوعی ویژوال به مهارت‌های پیاده‌سازی عملی نیاز دارند، کارآفرینانی که محصولات مبتنی بر بینایی می‌سازند و به تخصص فنی نیاز دارند، و دانشمندان داده که می‌خواهند به حوزه‌ بینایی کامپیوتری و یادگیری عمیق گسترش پیدا کنند، طراحی شده است.

بررسی برنامه‌ کامل دوره

  • ماژول 1: اصول پایه (پردازش تصویر و OpenCV) - تسلط به اصول اولیه: نمایش پیکسل، فضاهای رنگی (RGB و HSV و Grayscale)، تبدیلات هندسی و فیلترینگ با کرنل‌های کانولوشن - شما یک جعبه‌ ابزار دستکاری تصویر می‌سازید که کنترل کامل بر داده‌ ویژوال را نشان می‌دهد.
  • ماژول 2: یادگیری عمیق و CNNs - شما شبکه‌های عصبی مانند نورون‌ها، توابع فعال‌سازی، پس‌انتشار و نزول گرادیان را از پایه درک کرده و سپس می‌فهمید چرا CNNs برای بینایی به‌ طور منحصربه‌فردی مناسب‌ هستند: لایه‌های کانولوشن که ویژگی‌های سلسله‌مراتبی را یاد می‌گیرند، لایه‌های pooling برای ناوردایی مکانی و معماری کامل انقلابی در بینایی کامپیوتری
  • ماژول 3: معماری‌های پیشرفته‌ CNN - شما در میان نوآوری‌های برنده‌ ImageNet سفر کرده و عمق VGG، یادگیری باقیمانده‌ ResNet، پردازش چندمقیاسی Inception و مقیاس‌بندی متوازن EfficientNet را درک می‌کنید. شما به یادگیری انتقالی، قدرتمندترین تکنیک در بینایی کامپیوتری مدرن برای تطبیق مدل‌های از پیش‌ آموزش‌ دیده با تسک‌های سفارشی خود مسلط می‌شوید، روشی که زمان را ذخیره می‌کند و با داده‌ محدود، نتایج برتری به‌ دست می‌دهد.
  • ماژول 4: تشخیص آبجکت - شما سیستم‌هایی می‌سازید که چندین آبجکت را در تصاویر شناسایی و مکان‌یابی می‌کنند. شما آشکارسازهای دو مرحله‌ای (خانواده‌ R-CNN و Faster R-CNN) و آشکارسازهای تک‌مرحله‌ای (YOLO و SSD) را بررسی می‌کنید که عملکرد بلادرنگ ارائه می‌دهند. شما معماری مدرن DETR را پیاده‌ می‌کنید که از ترنسفرمرها برای تشخیص آبجکت end-to-end و بدون کامپوننت‌های دست‌ساز استفاده می‌کند.
  • ماژول 5: بخش‌بندی تصویر - شما طبقه‌بندی در سطح پیکسل را انجام می‌دهید تا ماسک‌های دقیق آبجکت ایجاد کنید. شما به بخش‌بندی سمانتیک با معماری رمزگذار-رمزگشا و اتصالات میانبر U-Net مسلط می‌شوید و بخش‌بندی نمونه‌ را با Mask R-CNN پیاده‌ می‌کنید. شما مدل‌های بنیادین مانند SAM (Segment Anything Model) را بررسی می‌کنید که قادر به بخش‌بندی zero-shot و قابل‌ هدایت با پرامپت هستند.
  • ماژول 6: مدل‌های مولد و ترنسفرمرهای بینایی - شما وارد مرز هوش مصنوعی ویژوال می‌شوید. شما رمزگذارهای خودکار متغیر (VAE) و نمایش‌های نهفته آنها را درک می‌کنید. شما شبکه‌های مولد متخاصم (GAN) می‌سازید که از طریق آموزش متخاصم تصاویر واقع‌گرایانه ایجاد می‌کنند. شما به ترنسفرمرهای بینایی (ViT)) و مکانیسم‌های self-attention آنها که کانتکس گلوبال را ضبط می‌کنند، مسلط می‌شوید و فضاهای تعبیه ویژوال را برای تسک‌های جستجوی تصویر و جستجوی شباهت ایجاد می‌کنید.

در پایان دوره، شما بینایی کامپیوتری را از اصول اولیه تا مدل‌های مرزی درک خواهید کرد، نه فقط اینکه چگونه از کتابخانه‌ها استفاده کنید، بلکه ریاضیات و شهود پشت هر تکنیک را نیز خواهید فهمید.

شما اپلیکیشن‌های آماده‌ تولید خواهید ساخت که آبجکت‌ها را تشخیص می‌دهند، تصاویر را بخش‌بندی کرده و محتوای ویژوال را با عملکرد پیشرفته تولید می‌کنند.

شما با اطمینان درباره‌ معماری‌هایی مانند ResNet و YOLO و U-Net و ترنسفرمرهای بینایی و DETR و SAM در مصاحبه‌های فنی شرکت‌هایی مانند گوگل، Tesla و آزمایشگاه‌های پیشروی هوش مصنوعی صحبت خواهید کرد.

شما سیستم‌های واقعی را با استفاده از TensorFlow و PyTorch و شیوه‌های مدرن MLOps مستقر خواهید کرد.

شما یک پورتفولیو شامل بیش از 7 پروژه‌ مرتبط با صنعت خواهید داشت که تخصص شما را در سراسر پایپ‌لاین کامل بینایی کامپیوتری نشان می‌دهد.

شما زبان فنی مهندسان CV را خواهید آموخت و تفاوت‌های میان دقت و سرعت، پیچیدگی مدل و نیازهای استقرار را درک خواهید کرد.

تحول شما از همین حالا آغاز می‌شود

از دستکاری پیکسل تا generative AI شما به کل این پایپ‌لاین مسلط خواهید شد. انقلاب ویژوال با شما یا بدون شما در حال رخ دادن است. تنها پرسش این است: آیا شما سازنده‌ آن خواهید بود یا فقط از دور تماشا می‌کنید؟

همین امروز در دوره شرکت کرده و از یک یادگیرنده‌ کنجکاو به یک مهندس مطمئن بینایی کامپیوتری تبدیل شوید.

این دوره شامل 34 ساعت محتوای ویدئویی، نمایش‌های عملی کدنویسی و بیش از 7 پروژه‌ کامل است.

به دانشجویانی بپیوندید که با این مسترکلاس جامع بینایی کامپیوتری، مسیر شغلی خود را متحول کرده‌اند. سفر شما از مبتدی تا مهندس حرفه‌ای بینایی کامپیوتری همین‌جا آغاز می‌شود.

این دوره برای چه کسانی مناسب است؟

  • Gemini گفت این دوره برای طیف متنوعی از متخصصان و افراد مشتاق طراحی شده است؛ از دانشجویان و فارغ‌التحصیلان تازه‌واردی که می‌خواهند در AI و بینایی کامپیوتری تخصص پیدا کنند تا در بازار رقابتی به نقش‌های پردرآمد دست یابند.
  • این دوره همچنین برای توسعه‌دهندگان نرم‌افزار، مهندسان و دانشمندان داده‌ که می‌خواهند شکاف میان برنامه‌نویسی سنتی و یادگیری عمیق را پر کنند و مهارت‌های خود را به پردازش تصویر و تحلیل داده‌ ویژوال گسترش دهند، بسیار مناسب است.
  • افرادی که از توسعه‌ وب یا سایر حوزه‌های فنی به مسیر شغلی جدیدی وارد می‌شوند، و نیز پژوهشگران و دانشگاهیانی که نیاز دارند مدل‌های نظری را به نمونه‌های عملی تبدیل کنند، این برنامه‌ درسی مهارت‌های لازم برای پیاده‌سازی عملی را فراهم می‌کند.
  • علاوه بر این، کارآفرینان و مدیران محصول که استارتاپ‌های مبتنی بر بینایی می‌سازند، پایه‌ فنی لازم برای محصولات دارای تشخیص و شناسایی آبجکت را به دست خواهند آورد.
  • در نهایت، مهندسان یادگیری ماشین که می‌خواهند معماری‌های پیشرفته‌ مانند ترنسفرمرهای بینایی را به‌ خوبی یاد بگیرند و علاقه‌مندان به هوش مصنوعی که مشتاق درک مکانیسم ماشین‌های خودران و تولید تصویر هستند، بینش‌های عمیقی را که برای ساخت این فناوری‌ها از پایه نیاز دارند، پیدا خواهند کرد.

تسلط به بینایی کامپیوتری - از پیکسل تا تشخیص تا Gen-CV

  • ماژول 1 - اصول بینایی کامپیوتری و پردازش تصویر 03:32
  • مقدمه‌ای بر بینایی کامپیوتری - اهداف یادگیری 04:03
  • مقدمه‌ای بر بینایی کامپیوتری 10:52
  • بینایی کامپیوتری چیست؟ 05:20
  • شکاف سمانتیک - چالش اصلی بینایی کامپیوتری 07:19
  • توضیح مثال کد 03:35
  • تکامل بینایی کامپیوتری 08:15
  • تشخیص لبه‌ Sobel 06:15
  • تشخیص لبه‌ Canny 03:13
  • توضیح مثال کد 03:37
  • استخراج ویژگی‌های HoG 07:13
  • تشخیص ویژگی‌های SIFT 04:11
  • توضیح مثال کد 04:17
  • طبقه‌بندهای یادگیری ماشین روی ویژگی‌های آموخته‌ شده 03:22
  • آموزش ماشین‌های بردار پشتیبان (SVM) 04:41
  • آموزش نزدیک‌ترین همسایه k (KNN) 03:34
  • توضیح مثال کد 06:34
  • عصر 2 - عصر یادگیری عمیق 05:33
  • عصر Generative AI 03:37
  • گردش‌کار جهانی بینایی کامپیوتری 02:34
  • توضیح تمرین کد 08:33
  • اصول تصویر دیجیتال - اهداف یادگیری 03:06
  • اصول تصویر دیجیتال 09:40
  • پیکسل - اتم بینایی 06:17
  • تصویر به‌ عنوان ماتریس - واقعیت ریاضی 04:08
  • تصاویر رنگی به‌ صورت ماتریس‌های سه‌بعدی 06:36
  • توضیح مثال کد 05:16
  • فضاهای رنگی - RGB افزایشی 09:18
  • فضاهای رنگی - HSV برای تشخیص قوی 09:41
  • فضاهای رنگی - Grayscale 06:56
  • توضیح مثال کد 05:07
  • عمق تصویر (عمق بیت) 06:31
  • توضیح مثال کد 02:36
  • بینایی کامپیوتری به‌ صورت عملی با OpenCV 04:59
  • توضیح مثال کد 08:01
  • توضیح تمرین کد 07:58
  • تکنیک‌های ضروری پیش‌پردازش تصویر - اهداف یادگیری 03:54
  • پیش‌پردازش تصویر 07:13
  • تبدیل تصویر 03:26
  • توضیح مثال کد 02:18
  • تبدیلات هندسی 05:22
  • تبدیل هندسی - بخش 1 - مقیاس‌بندی 04:32
  • تبدیل هندسی - بخش 2 - چرخش و انتقال 03:34
  • تبدیلات هندسی OpenCV به‌ صورت عملی 03:30
  • توضیح مثال کد 03:36
  • تبدیل هندسی - بخش 3 - آفین در برابر پرسپکتیو 06:21
  • توضیح مثال کد 02:30
  • ریاضیات تبدیلات هندسی 05:33
  • تنظیمات فوتومتریک - فیکس کردن نور و کنتراست 04:00
  • تنظیمات فوتومتریک - همسان‌سازی هیستوگرام 04:18
  • توضیح مثال کد 03:49
  • فیلترینگ - جادوی کانولوشن 06:33
  • کرنل‌ها - فیلترهای دست‌ساز برای بینایی 02:54
  • توضیح مثال کد 03:06
  • عملی - پیش‌پردازش برای تشخیص چهره 06:08
  • توضیح مثال کد 06:22
  • توضیح تمرین کد 12:25
  • ماژول 2 - اصول یادگیری عمیق و شبکه‌های عصبی کانولوشن (CNN) - مقدمه 02:16
  • از پرسپترون‌ها تا شبکه‌های عصبی عمیق - اهداف یادگیری 04:14
  • تاریخچه‌ بینایی کامپیوتری - 1950 تا دهه‌ 1990 05:39
  • عصر مدرن بینایی کامپیوتری - از دهه‌ 1990 تا امروز 04:44
  • توضیح مثال کد 07:01
  • ریاضیات کامل از لایه‌ ورودی تا اولین لایه‌ پنهان 09:42
  • تابع فعال‌سازی 05:50
  • لایه پنهان 2 شبکه‌ عصبی 04:47
  • ریاضیات کامل نورون لایه‌ خروجی 04:11
  • انواع لایه‌ها و نقش‌های آنها 03:00
  • توضیح مثال کد 07:01
  • فرآیند یادگیری دو مرحله‌ای - گذر رو به جلو 05:33
  • آنتروپی متقاطع برای طبقه‌بندی باینری 06:58
  • آنتروپی متقاطع برای طبقه‌بندی چندکلاسه 06:09
  • گذر رو به عقب - یادگیری از اشتباهات 09:37
  • نزول گرادیان 05:26
  • توضیح مثال کد 06:16
  • فرآیند یادگیری دو مرحله‌ای - خلاصه 07:20
  • هایپرپارامتر نرخ یادگیری و نقش Optimizer 03:46
  • توضیح مثال کد 03:33
  • توضیح تمرین کد 14:57
  • معماری CNN - اهداف یادگیری 03:05
  • چرا DNNs در تسک‌های بینایی کامپیوتری شکست می‌خورند؟ 10:51
  • توضیح مثال کد 05:51
  • درک شبکه‌های عصبی کانولوشن (DNNs) 08:45
  • عملیات کانولوشن و فرآیند پنجره‌ لغزان 08:57
  • انواع فیلترهای کانولوشن 05:20
  • Strides و padding 13:48
  • توضیح مثال کد 04:12
  • فعال‌سازی ReLU و MaxPooling 06:26
  • فعال‌سازی ReLU - درک مفهومی 06:23
  • Pooling - درک مفهومی 05:20
  • توضیح مثال کد 03:21
  • مثال CNN دو لایه‌ای 01:04
  • لایه‌ متراکم یا کاملاً متصل و لایه‌ خروجی 05:36
  • اتصال‌پذیری محلی و اشتراک‌گذاری وزن در CNN 02:26
  • تغییرناپذیری ترجمه و ساخت ویژگی سلسله‌مراتبی 03:54
  • توضیح مثال کد 05:00
  • توضیح تمرین کد 15:14
  • ساخت اولین CNN خود - اهداف یادگیری 03:41
  • هدف عملی - یک CNN را برای دیدن آموزش دهید 08:55
  • داده - مهم‌ترین عنصر 12:57
  • تانسورها به‌ عنوان ورودی داده و GPU به‌ عنوان شتاب‌دهنده 07:10
  • مزیت PyTorch 05:02
  • توضیح مثال کد 05:35
  • معماری CNN - اولین مدل ما 07:44
  • خروجی لایه‌به‌لایه‌ معماری CNN 02:26
  • توضیح مثال کد2 03:14
  • گذر رو به جلو، پس‌انتشار و ارزیابی 06:02
  • سه‌گانه‌ آموزش 05:57
  • استراتژی‌های مؤثر آموزش و عیب‌یابی 05:04
  • حلقه‌ آموزش - جایی که یادگیری واقعاً رخ می‌دهد 02:28
  • مشکلات رایج و راه‌حل‌ها 03:59
  • توضیح مثال کد 2.3.3 04:17
  • فراتر از آموزش - مدل ما چقدر خوب است؟ 07:10
  • آموزش CNN - چک‌لیست 06:18
  • توضیح مثال کد 05:51
  • توضیح تمرین کد 12:36
  • ماژول 3 - معماری‌های پیشرفته‌ CNN و یادگیری انتقالی - مقدمه 02:32
  • معماری‌های لندمارک CNN - اهداف درس 03:41
  • معماری‌های CNN - بررسی LeNet-5 (1998) 12:14
  • تکامل معماری‌های لندمارک CNN 04:34
  • AlexNet (2012) 08:56
  • توضیح مثال کد 01:38
  • VGGNet (2014) 07:43
  • ResNet (2015) 12:32
  • توضیح مثال کد 06:22
  • Inception (GoogLeNet) 2014 10:47
  • DenseNet 2017 07:31
  • EfficientNet (2019) 11:06
  • چگونه معماری مناسب (ستون فقرات) CNN را انتخاب کنیم؟ 02:46
  • یادگیری انتقالی و فاین تیونینگ - اهداف یادگیری 03:23
  • دو رویکرد - یادگیری انتقالی و فاین تیونینگ 08:48
  • انگیزه - چرا مدل‌های از پیش‌ آموزش‌ دیده را دوباره استفاده کنیم؟ 09:34
  • استخراج ویژگی - انتخاب مطمئن 06:13
  • مکانیسم - چگونه استخراج ویژگی را پیاده‌سازی کنیم؟ 04:10
  • توضیح مثال کد 11:04
  • فاین تیونینگ - شرط‌بندی روی عملکرد بالا 09:45
  • گام جریان گرادیان 08:20
  • نرخ‌های یادگیری تفاضلی - کلید آموزش موفق 06:45
  • Elastic Weight Consolidation (EWC) 06:48
  • توضیح مثال کد 09:29
  • درک CNNs - از پیکسل‌ها تا آموزش پیشرفته 02:51
  • نکات حرفه‌ای برای آموزش موفق مدل در بینایی کامپیوتری 01:42
  • گردش‌کار عملی از صفر تا حرفه‌ای 06:01
  • توضیح مثال کد 05:44
  • بهبود عملکرد مدل CNN - اهداف یادگیری 03:43
  • تشخیص مسئله - بیش‌برازش (واریانس بالا) 07:52
  • تشخیص مسئله - کم‌برازش (بایاس بالا) 06:09
  • دو روش برای بهبود عملکرد مدل 02:04
  • بهبود عملکرد مدل - استحکام و تعمیم‌پذیری 04:44
  • توضیح مثال کد 05:15
  • افزایش داده - چگونه و چرا؟ 02:31
  • افزایش داده - تا وقتی به نتیجه برسید، شبیه‌سازی کنید 05:24
  • افزایش داده - ابزارهای هندسی 05:31
  • افزایش داده - ابزارهای فوتومتریک و MixUp 05:57
  • توضیح مثال کد 05:10
  • منظم‌سازی برای مهار مدل - Dropout 11:24
  • Weight Decay (منظم‌سازی لایه 2) 05:55
  • هموارسازی برچسب - مقابله با بیش‌اعتمادی 06:10
  • توضیح مثال کد 12:48
  • اثر هم‌افزایی - افزایش داده و منظم‌سازی 01:22
  • جمع‌بندی 05:17
  • توضیح مثال کد 07:15
  • ماژول 4 - تشخیص آبجکت با یادگیری عمیق - مقدمه 04:54
  • مقدمه‌ای بر تشخیص آبجکت - اهداف درس 03:33
  • مقدمه‌ای بر تشخیص آبجکت 10:12
  • تعریف تسک - چه چیزی و کجا؟ 04:07
  • ساختار خروجی تشخیص 06:10
  • توضیح مثال کد - بخش 1 05:25
  • مثال ویژوال - Intersection روی Union (IoU) در عمل 03:15
  • متریک‌های Intersection روی Union (IoU) 03:52
  • خوب، بد و زشت - مقادیر IoU 04:00
  • توضیح مثال کد - بخش 2 05:19
  • موازنه‌ دقت و بازیابی و نمایش هندسی mAP 04:19
  • محاسبه‌ گام‌به‌گام میانگین متوسط دقت (mAP) 07:08
  • تفسیر مقادیر میانگین متوسط دقت (mAP) 04:20
  • توضیح مثال کد - بخش 3 05:31
  • سرکوب غیرحداکثری 06:07
  • سرکوب غیرحداکثری (NMS) - توضیح با یک مثال 03:09
  • تشخیص آبجکت - پایپ‌لاین سطح بالا 07:06
  • توضیح مثال کد - بخش 4 07:17
  • آشکارسازهای دو مرحله‌ای (خانواده‌ R-CNN) - اهداف یادگیری 03:55
  • رویکرد و تکامل آشکارسازهای دو مرحله‌ای 02:48
  • آشکارسازهای دو مرحله‌ای - خانواده‌ R-CNN 08:26
  • توضیح مثال کد - بخش 1 04:38
  • R-CNN (2014) و مسئله 13:06
  • Fast R-CNN (2015) - توضیح با یک مثال 02:14
  • Fast R-CNN (2015) - مغز مشترک 07:34
  • توضیح مثال کد - بخش 2 03:47
  • R-CNN (2015) سریع‌تر - نوآوری شبکه‌ پیشنهاد ناحیه (RPN) 04:10
  • R-CNN (2015) سریع‌تر - استاندارد مدرن 05:25
  • R-CNN (2015) سریع‌تر - پایپ‌لاین کامل 04:03
  • مقایسه‌ خانواده‌ R-CNN - تکامل 04:15
  • توضیح مثال کد - بخش 3 09:34
  • آشکارسازهای تک‌مرحله‌ای (YOLO و SSD) - اهداف یادگیری 03:51
  • گذار از آشکارساز آبجکت دو مرحله‌ای به تک‌مرحله‌ای 09:16
  • انقلاب رگرسیون در برابر پیشنهاد 05:15
  • تفاوت‌های ریاضی و عملی R-CNN و YOLO 06:06
  • توضیح مثال کد - بخش 1 03:58
  • YOLO - فقط یکبار نگاه کنید 10:43
  • ریاضیات تابع ضرر YOLO 05:51
  • محدودیت‌های مدل YOLO نسخه 1 06:29
  • توضیح مثال کد - بخش 2 08:14
  • SSD - هرم ویژگی چندمقیاسی 06:22
  • SSD - انکر باکس‌ها (باکس‌های پیش‌فرض) 07:43
  • توضیح مثال کد - بخش 3 06:04
  • مقایسه‌ آشکارسازها و راهنمایی عملی 06:03
  • توضیح مثال کد - بخش 4 05:50
  • معماری‌های مدرن - آشکارسازهای end-to-end (DETR) - اهداف یادگیری 03:23
  • معماری‌های مدرن - آشکارسازهای end-to-end (DETR) 11:54
  • روش مدل ترنسفرمر تشخیص (DETR) 03:17
  • نوآوری اصلی - ترنسفرمرها در بینایی 12:19
  • توضیح مثال کد - بخش 1 06:47
  • پایپ‌لاین DETR - بخش 1 - ستون فقرات 12:05
  • پایپ‌لاین DETR - بخش 2 - رمزگذار ترنسفرمر 10:12
  • پایپ‌لاین DETR - بخش 3 - رمزگشا و پیش‌بینی‌ها 07:44
  • پایپ‌لاین DETR - بخش 4 - FFNs پیش‌بینی 02:34
  • توضیح مثال کد - بخش 2 04:47
  • گردش‌کار کامل DETR 04:55
  • راز اصلی - ضرر تطبیق دوجهتی 07:53
  • DETR در برابر جهان - یک پارادایم شیفت 06:38
  • توضیح مثال کد - بخش 3 03:18
  • ماژول 5 - بخش‌بندی تصویر با یادگیری عمیق - مقدمه 02:43
  • ماژول 5 - بخش‌بندی تصویر با یادگیری عمیق - مقدمه 02:49
  • بخش‌بندی سمانتیک در برابر بخش‌بندی نمونه‌ 05:54
  • هدف طبقه‌بندی در سطح پیکسل 09:37
  • توضیح مثال کد - بخش 1 03:03
  • معماری بخش‌بندی سمانتیک 03:10
  • بخش‌بندی سمانتیک - موارد لازم 05:52
  • بینش ریاضیاتی (ضرر پیکسلی) 06:47
  • توضیح مثال کد - بخش 2 03:56
  • معماری بخش‌بندی نمونه‌ 02:07
  • بخش‌بندی نمونه‌ - موارد لازم 08:59
  • بینش ریاضیاتی - ضرر هیبریدی چندتسکی 06:34
  • توضیح مثال کد - بخش 3 04:05
  • معماری‌های بخش‌بندی سمانتیک (FCN و U-Net) - اهداف یادگیری 04:38
  • تکامل معماری بخش‌بندی سمانتیک 05:54
  • مسئله‌ اصلی - از برچسب کلی تا نقشه‌ پیکسل 03:30
  • راه‌حل معماری‌ها 02:23
  • توضیح مثال کد - بخش 1 03:27
  • طراحی رمزگذار و رمزگشا - بخش 1 - رمزگذار 05:49
  • طراحی رمزگذار و رمزگشا - بخش 2 - رمزگشا 07:22
  • توضیح مثال کد - بخش 2 03:23
  • روش شبکه‌ کاملاً کانولوشن 01:26
  • طراحی شبکه‌ کاملاً کانولوشن 05:07
  • مشکل گلوگاه و راه‌حل اتصال میان‌بر 03:45
  • توضیح مثال کد - بخش 3 03:24
  • روش بخش‌بندی سمانتیک U-Net 01:21
  • U-Net با دقت جراحی (2015) 01:58
  • چرا الحاق بهتر است؟ 04:44
  • FCN در برابر U-Net و کاربردهای واقعی 04:59
  • توضیح مثال کد - بخش 4 09:32
  • معماری‌های بخش‌بندی نمونه‌ (Mask R-CNN) - اهداف یادگیری 02:39
  • معماری‌های بخش‌بندی نمونه‌ (Mask R-CNN) 09:10
  • گسترش معماری R-CNN سریع‌تر با Mask Head 04:15
  • ترفند دی‌کوپلینگ - ماسک‌های مستقل از کلاس 06:06
  • توضیح مثال کد - بخش 1 07:29
  • مشکل - خطای کوانتیزاسیون در ROI Pooling 03:47
  • راه‌حل - همسویی ROI 04:27
  • مکانیسم ریاضیات پشت Mask R-CNN 04:50
  • توضیح مثال کد - بخش 2 04:53
  • مدل‌های بنیادین برای بخش‌بندی (SAM) - اهداف یادگیری 02:49
  • SAM به‌ عنوان لحظه‌ GPT برای تصاویر 01:48
  • مدل‌های بنیادین برای بخش‌بندی (SAM) 05:14
  • گذار از متخصصان به همه‌فن‌حریف‌ها 03:12
  • توضیح مثال کد - بخش 1 03:40
  • بررسی معماری SAM 02:12
  • معماری SAM - بخش 1 - رمزگذار تصویر 05:29
  • معماری SAM - بخش 2 - رمزگذار پرامپت (مترجم) 05:50
  • معماری SAM - بخش 3 - رمزگشای ماسک (هنرمند) 03:45
  • توضیح مثال کد - بخش 2 04:55
  • معماری و تکامل SAM 2 05:23
  • معماری و تکامل SAM 3 06:10
  • مقایسه‌ SAM در برابر SAM 2 در برابر SAM 3 و کاربردهای واقعی 04:30
  • توضیح مثال کد - بخش 3 03:43
  • ماژول 6 - مدل‌های مولد و فراتر از CNNs - مقدمه 04:18
  • خودرمزگذارها (AEs) و خودرمزگذارهای متغیر (VAEs) - اهداف یادگیری 04:41
  • خودرمزگذارها در برابر خودرمزگذارهای متغیر 10:08
  • فضای محیطی (آشوب)، منیفولد و فضای نهفته 05:41
  • هسته‌ Gen AI - منیفولد، فضای نهفته و خودرمزگذارها 06:05
  • رمزگشا - از بلوپرینت تا بازگشت به تصویر 05:27
  • توضیح مثال کد - بخش 1 03:47
  • بررسی معماری خودرمزگذار (AE) 02:11
  • پیاده‌سازی خودرمزگذار و محدودیت‌ها 04:37
  • تابع ضرر خودرمزگذار 06:44
  • توضیح مثال کد - بخش 2 04:40
  • بررسی معماری خودرمزگذارهای متغیر (VAE) 02:25
  • خودرمزگذارهای متغیر - انقلاب احتمالاتی 04:05
  • ترفند پارامتردهی مجدد در بینایی کامپیوتری مولد (VAE) 05:52
  • درک زیان VAE و تقابل AE با VAE 05:01
  • توضیح مثال کد - بخش 3 06:42
  • مقایسه‌ AE و VAE 06:53
  • نمایش‌های گسسته‌سازی‌ شده‌ β-VAE 05:21
  • VAE شرطی (cVAE) 06:04
  • کاربردهای واقعی AEs و VAEs 04:05
  • توضیح مثال کد - بخش 4 04:51
  • شبکه‌های مولد متخاصم (GANs) - اهداف یادگیری 05:43
  • شبکه‌های مولد متخاصم (GANs) 10:28
  • حلقه‌ آموزش GAN - مسیر رسیدن به تعادل Nash 06:24
  • موتور ریاضیات - بازی Minimax 05:40
  • توضیح مثال کد - بخش 1 05:41
  • معماری DCGAN - نقشه‌ راه برای GANs پایدار 11:10
  • Choreography آموزش GAN - بخش 1 - آموزش Discriminator 05:06
  • Choreography آموزش GAN - بخش 2 - آموزش مولد 03:23
  • Choreography کامل آموزش 03:06
  • توضیح مثال کد - بخش 2 07:56
  • چالش‌های GAN - فروپاشی حالت و محوشدگی گرادیان‌ 03:54
  • راه‌حل - Wasserstein GAN (WGAN) 05:33
  • مزایای WGAN و جزئیات پیاده‌سازی 02:16
  • توضیح مثال کد - بخش 3 06:27
  • معماری StyleGAN - سنتز گسسته‌سازی‌ شده 05:34
  • معماری‌های پیشرفته‌ GAN - بررسی StyleGAN 04:10
  • CycleGAN - ترجمه‌ تصویر به تصویر بدون جفت 02:21
  • ترجمه با CycleGAN بدون داده‌ جفت‌ شده 05:17
  • ارزیابی متریک‌های GAN بدون‌ نظارت 06:58
  • توضیح مثال کد - بخش 4 05:13
  • مقدمه‌ای بر ترنسفرمرهای بینایی (ViT) - اهداف یادگیری 05:01
  • ترنسفرمرهای بینایی (ViT) - پارادایم شیفت 06:14
  • معماری ترنسفرمرهای بینایی (ViT) 07:58
  • چرا بینایی به دیدی جهانی نیاز دارد؟ 08:18
  • CNN در برابر ViT - داستان دو دیدگاه 03:22
  • توضیح مثال کد - بخش 1 04:43
  • موتور بینایی - توضیح self-attention 04:09
  • self-attention و multi-head attention 06:44
  • از پیکسل‌ها تا توکن‌ها - فرآیند patching در ViT 04:05
  • گام 1 - مسطح‌سازی Patches به تعبیه توکن‌ها 05:49
  • پایپ‌لاین کامل 03:23
  • گام 2 - پروجکشن خطی از پیکسل‌ها به واژه‌های ویژوال 05:02
  • توضیح مثال کد - بخش 2 08:34
  • گام 3 - انکودینگ مکانی حافظه‌ فضایی بینایی 09:01
  • گام 4 - رمزگذار ترنسفرمر هسته‌ پردازش 08:00
  • نرمال‌سازی لایه‌ای، MLP و اتصالات باقیمانده 07:34
  • توضیح مثال کد - بخش 3 06:36
  • Energy Landscape-Aware ViT (ELA-ViT) 03:11
  • ترنسفرمر بینایی Hypergraph (HgVT) 02:47
  • نوآوری‌های ترنسفرمر بینایی در 2025 04:09
  • ترنسفرمر تصویر Data-efficient (DeiT) 09:47
  • ترنسفرمر Swin - بررسی ترنسفرمر بینایی سلسله‌مراتبی 08:01
  • توضیح مثال کد - بخش 4 03:20
  • تعبیه‌های ویژوال و جستجوی تصویر - اهداف یادگیری 02:47
  • درک مدل‌های تعبیه در بینایی کامپیوتری مولد 04:55
  • تعبیه‌های ویژوال و جستجوی تصویر - نقشه‌ تصاویر 09:23
  • از پیکسل‌ها تا بردارهای سمانتیک - پایپ‌لاین تعبیه 07:52
  • پیش‌پردازش تصویر در بینایی کامپیوتری مولد - تغییر اندازه و نرمال‌سازی 01:57
  • نهایی‌سازی تعبیه - پروجکشن و نرمال‌سازی 06:54
  • نرمال‌سازی لایه 2 و رزونانس با شباهت کسینوسی 04:00
  • توضیح مثال کد - بخش 1 05:23
  • SimCLR - یادگیری نمایش‌های ویژوال از Views افزوده‌ شده 02:00
  • یادگیری تطبیقی با SimCLRTeaching 05:49
  • Triplet Loss در شناسایی چهره 06:11
  • جستجوی کارآمد - یافتن یک تصویر در میان میلیاردها تصویر 05:39
  • استراتژی‌های ایندکس‌گذاری FAISS 03:38
  • توضیح مثال کد - بخش 2 03:23
  • ایندکس فایل وارونه (IVF) برای جستجوی کارآمد 08:57
  • ایندکس کوانتیزاسیون محصول (PQI) برای جستجوی کارآمد 10:37
  • Hierarchical Navigable Small World (HNSW) برای جستجوی کارآمد 02:39
  • توضیح مثال کد - بخش 3 06:49
  • کاربرد 1 - جستجوی معکوس تصویر 04:59
  • شناسایی چهره و ArcFace 03:33
  • معماری دو رمزگذار CLIP 02:38
  • کاربرد جستجوی چندوجهی با CLIP 01:27
  • توضیح مثال کد - بخش 4 03:30

20,280,800 5,070,200 تومان

مشخصات آموزش

تسلط به بینایی کامپیوتری - از پیکسل تا تشخیص تا Gen-CV

  • تاریخ به روز رسانی: 1405/04/02
  • سطح دوره:Alls
  • تعداد درس:360
  • مدت زمان :34:01:43
  • حجم :21.7GB
  • زبان:دوبله زبان فارسی
  • دوره آموزشی:AI Academy

آموزش های مرتبط

  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
1,833,000 366,600 تومان
  • زمان: 02:27:39
  • تعداد درس: 24
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
2,260,000 452,000 تومان
  • زمان: 03:02:02
  • تعداد درس: 14
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
795,000 159,000 تومان
  • زمان: 58:00
  • تعداد درس: 12
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
19,403,000 3,880,600 تومان
  • زمان: 26:02:40
  • تعداد درس: 175
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
8,508,000 1,701,600 تومان
  • زمان: 11:25:13
  • تعداد درس: 94
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
6,100,500 1,220,100 تومان
  • زمان: 08:11:21
  • تعداد درس: 28
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
7,256,500 1,451,300 تومان
  • زمان: 09:44:25
  • تعداد درس: 67
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
3,634,500 726,900 تومان
  • زمان: 04:52:43
  • تعداد درس: 38
  • سطح دوره:
  • زبان: دوبله فارسی

آیا سوالی دارید؟

ما به شما کمک خواهیم کرد تا شغل و رشد خود را افزایش دهید.
امروز با ما تماس بگیرید