تسلط به بینایی کامپیوتری - از پیکسل تا تشخیص تا Gen-CV
✅ سرفصل و جزئیات آموزش
آنچه یاد خواهید گرفت:
- تسلط به اصول بینایی کامپیوتری: درک میکنید که رایانهها چگونه داده ویژوال را پردازش و تفسیر میکنند؛ از دستکاری پیکسلها و فضاهای رنگی تا فیلترینگ پیشرفته
- ساخت و استقرار مدلهای یادگیری عمیق: شبکههای عصبی کانولوشن (CNN) را با استفاده از TensorFlow و PyTorch طراحی، آموزش و بهینه میکنید، از جمله معماریهای پیشرفته
- پیادهسازی سامانههای تشخیص آبجکت پیشرفته: با استفاده از YOLO و R-CNN سریعتر و DETR و اپلیکیشنهای تشخیص آبجکت آماده تولید میسازید که بتوانند شناسایی کنند.
- ایجاد مدلهای پیشرفته بخشبندی و مولد: سیستمهای بخشبندی سمانتیک و نمونه را با U-Net و Mask R-CNN میسازید و اپلیکیشنهای generative AI ایجاد میکنید.
- اعمال تکنیکهای یادگیری انتقالی و فاین تیونینگ: از مدلهای از پیش آموزش دیده روی ImageNet و سایر مجموعه دادههای بزرگ برای حل مؤثر مسائل بینایی کامپیوتری سفارشی بهره میگیرید.
- توسعه پورتفولیوی حرفهای: بیش از 7 پروژه مرتبط با صنعت را تکمیل میکنید، از جمله classifiers تصویر، آشکارسازهای آبجکت بلادرنگ و ابزارهای حذف پسزمینه
- درک نظریه و ریاضیات پشت یادگیری عمیق: اصول ریاضی پشت شبکههای عصبی را درک میکنید، از جمله پسانتشار، نزول گرادیان و توابع ضرر
- تسلط به ابزارها و چارچوبهای استاندارد صنعت: کسب مهارت در TensorFlow و PyTorch و OpenCV و scikit-image و شیوههای مدرن MLOps برای استقرار مدل
- آمادگی برای مصاحبههای مهندسی بینایی کامپیوتری: با اطمینان درباره معماریهایی مانند اتصالات باقیمانده ResNet، تشخیص تکمرحلهای YOLO بحث میکنید.
- استقرار مدلها در تولید: بهترین شیوهها برای بهینهسازی مدل، کوانتیزاسیون، پایپلاینهای استقرار و ارائه مدلهای بینایی کامپیوتری در کاربردهای واقعی را میآموزید.
پیشنیازهای دوره
- برای بهره بردن حداکثری از دوره، باید درک خوبی از برنامهنویسی اولیه پایتون داشته باشید؛ از جمله متغیرها، حلقهها، توابع و شرطیها و همچنین با Jupyter Notebooks یا IDE دلخواه پایتون خود آشنا باشید.
- هر چند آشنایی پایه با ریاضیات به ویژه جبر و مفاهیم اولیه حسابان مفید است، اما الزامی نیست.
- از نظر سختافزاری، به یک رایانه با حداقل 8GB RAM و دسترسی مدیریتی برای نصب پکیجهای پایتون نیاز دارید.
- مهمتر از همه، هیچ تجربه قبلی در یادگیری ماشین، یادگیری عمیق یا بینایی کامپیوتری لازم نیست، زیرا همه موارد را از ابتدا شروع میکنیم
- تنها چیزی که نیاز دارید اشتیاق به یادگیری و تمایل به ورود به پروژههای کدنویسی عملی است.
توضیحات دوره
تسلط به بینایی کامپیوتری: از پیکسل تا تشخیص تا Gen-CV
در 34 ساعت، از یک یادگیرنده کنجکاو به یک مهندس بینایی کامپیوتری مطمئن تبدیل شوید.
آیا آمادهاید فناوری را بسازید که جهان ویژوال ما را شکل میدهد؟
بینایی کامپیوتری فقط آینده نیست همین حالا در جریان است. ماشینهای خودران در خیابانها ناوبری میکنند. اپلیکیشنها چهره شما را تشخیص میدهند. هوش مصنوعی آثار هنری خیرهکننده خلق میکند. پشت هر نوآوری ویژوال، فناوری بینایی کامپیوتری قرار دارد و تقاضا برای مهندسان ماهر بینایی کامپیوتری هرگز تا این اندازه بالا نبوده است. شرکتهایی مانند گوگل، Tesla و Meta و بیشمار استارتاپ دیگر به شدت به دنبال متخصصانی هستند که بتوانند سامانههای بینایی را بسازند، مستقر و بهینهسازی کنند.
اما چالش اینجاست: بیشتر دورهها یا شما را در نظریه غرق میکنند بدون اینکه کاربرد عملی ارائه دهند، یا شما را بدون ایجاد دانش پایهای لازم، مستقیم وارد چارچوبهای یادگیری عمیق میکنند؛ در حالی که برای موفقیت واقعی به آن پایه نیاز دارید.
این دوره متفاوت است.
«تسلط به بینایی کامپیوتری - از پیکسل تا تشخیص تا Gen-CV» مسیر کامل را ارائه میدهد از درک اینکه رایانهها چگونه پیکسلهای جداگانه را پردازش میکنند تا استقرار مدلهای generative AI پیشرفته
چه دانشجویی باشید که میخواهد متمایز شود، چه یک فرد حرفهای که مسیر شغلی خود را تغییر میدهد، چه پژوهشگری که به مهارتهای پیادهسازی نیاز دارد، یا کارآفرینی که محصولی مبتنی بر بینایی میسازد، این مسیر جامع شما را از صفر تا آمادگی برای استقرار پیش میبرد.
آنچه دوره را منحصربهفرد میکند؟
معماری یادگیری تدریجی: ما هیچ مرحلهای را حذف نمیکنیم. شما با پردازش کلاسیک تصویر و مبانی OpenCV شروع میکنید و شهود لازم برای درک اینکه رایانهها واقعاً چگونه «میبینند» را میسازید. شما سپس شبکههای عصبی کانولوشن را به طور کامل یاد میگیرید؛ نه فقط اینکه چگونه از آنها استفاده کنید، بلکه چرا کار میکنند. در نهایت، معماریهای پیشرفته مانند ترنسفرمرهای بینایی، DETR و SAM را بررسی میکنید همان مدلهایی که امروز پشت پیشرفتهای هوش مصنوعی قرار دارند.
34 ساعت تمرین عملی: هر مفهوم با کد نمایش داده میشود. هر ماژول شامل پروژههای عملی است. شما فقط ویدئو تماشا نمیکنید بلکه با TensorFlow و PyTorch و فریمورکهای استاندارد صنعت، اپلیکیشنهای واقعی میسازید.
بیش از 7 پروژه آماده برای پورتفولیو: در پایان دوره، یک CNN برای دستهبندی مد با دقت بیش از %92، یک آشکارساز آبجکت YOLO بلادرنگ با سرعت 45+ FPS، یک سیستم حذف پسزمینه مبتنی بر U-Net، یک اپلیکیشن انتقال سبک تصویر، یک سامانه تشخیص چهره با شناسایی نقاط کلیدی، یک ابزار بخشبندی نمونه Mask R-CNN، و مدلهای سفارشی آموزش دیده از پایه و مستقر شده در تولید را ساختهاید.
آمادگی برای مصاحبه داخلی: با اطمینان درباره اتصالات باقیمانده ResNet، نوآوریهای معماری YOLO، اتصالات میانبر U-Net و مکانیسم توجه (attention) در ترنسفرمرهای بینایی صحبت خواهیم کرد. هر معماری با شفافیت توضیح داده میشود تا بتوانید در مصاحبههای فنی، «دلیل» پشت «چگونگی» را بیان کنید.
مخاطبان دوره:
این دوره برای گروههای مختلف از جمله دانشجویانی که به دنبال مهارتهای تخصصی هوش مصنوعی هستند تا در بازار کار رقابتی برجسته شوند، توسعهدهندگان نرمافزار که میخواهند بینایی کامپیوتری را به ابزار حرفهای خود اضافه کنند، افرادی که مسیر شغلی خود را تغییر میدهند و به نقشهای پردرآمد مهندسی هوش مصنوعی وارد میشوند، پژوهشگرانی که برای پروژههای هوش مصنوعی ویژوال به مهارتهای پیادهسازی عملی نیاز دارند، کارآفرینانی که محصولات مبتنی بر بینایی میسازند و به تخصص فنی نیاز دارند، و دانشمندان داده که میخواهند به حوزه بینایی کامپیوتری و یادگیری عمیق گسترش پیدا کنند، طراحی شده است.
بررسی برنامه کامل دوره
- ماژول 1: اصول پایه (پردازش تصویر و OpenCV) - تسلط به اصول اولیه: نمایش پیکسل، فضاهای رنگی (RGB و HSV و Grayscale)، تبدیلات هندسی و فیلترینگ با کرنلهای کانولوشن - شما یک جعبه ابزار دستکاری تصویر میسازید که کنترل کامل بر داده ویژوال را نشان میدهد.
- ماژول 2: یادگیری عمیق و CNNs - شما شبکههای عصبی مانند نورونها، توابع فعالسازی، پسانتشار و نزول گرادیان را از پایه درک کرده و سپس میفهمید چرا CNNs برای بینایی به طور منحصربهفردی مناسب هستند: لایههای کانولوشن که ویژگیهای سلسلهمراتبی را یاد میگیرند، لایههای pooling برای ناوردایی مکانی و معماری کامل انقلابی در بینایی کامپیوتری
- ماژول 3: معماریهای پیشرفته CNN - شما در میان نوآوریهای برنده ImageNet سفر کرده و عمق VGG، یادگیری باقیمانده ResNet، پردازش چندمقیاسی Inception و مقیاسبندی متوازن EfficientNet را درک میکنید. شما به یادگیری انتقالی، قدرتمندترین تکنیک در بینایی کامپیوتری مدرن برای تطبیق مدلهای از پیش آموزش دیده با تسکهای سفارشی خود مسلط میشوید، روشی که زمان را ذخیره میکند و با داده محدود، نتایج برتری به دست میدهد.
- ماژول 4: تشخیص آبجکت - شما سیستمهایی میسازید که چندین آبجکت را در تصاویر شناسایی و مکانیابی میکنند. شما آشکارسازهای دو مرحلهای (خانواده R-CNN و Faster R-CNN) و آشکارسازهای تکمرحلهای (YOLO و SSD) را بررسی میکنید که عملکرد بلادرنگ ارائه میدهند. شما معماری مدرن DETR را پیاده میکنید که از ترنسفرمرها برای تشخیص آبجکت end-to-end و بدون کامپوننتهای دستساز استفاده میکند.
- ماژول 5: بخشبندی تصویر - شما طبقهبندی در سطح پیکسل را انجام میدهید تا ماسکهای دقیق آبجکت ایجاد کنید. شما به بخشبندی سمانتیک با معماری رمزگذار-رمزگشا و اتصالات میانبر U-Net مسلط میشوید و بخشبندی نمونه را با Mask R-CNN پیاده میکنید. شما مدلهای بنیادین مانند SAM (Segment Anything Model) را بررسی میکنید که قادر به بخشبندی zero-shot و قابل هدایت با پرامپت هستند.
- ماژول 6: مدلهای مولد و ترنسفرمرهای بینایی - شما وارد مرز هوش مصنوعی ویژوال میشوید. شما رمزگذارهای خودکار متغیر (VAE) و نمایشهای نهفته آنها را درک میکنید. شما شبکههای مولد متخاصم (GAN) میسازید که از طریق آموزش متخاصم تصاویر واقعگرایانه ایجاد میکنند. شما به ترنسفرمرهای بینایی (ViT)) و مکانیسمهای self-attention آنها که کانتکس گلوبال را ضبط میکنند، مسلط میشوید و فضاهای تعبیه ویژوال را برای تسکهای جستجوی تصویر و جستجوی شباهت ایجاد میکنید.
در پایان دوره، شما بینایی کامپیوتری را از اصول اولیه تا مدلهای مرزی درک خواهید کرد، نه فقط اینکه چگونه از کتابخانهها استفاده کنید، بلکه ریاضیات و شهود پشت هر تکنیک را نیز خواهید فهمید.
شما اپلیکیشنهای آماده تولید خواهید ساخت که آبجکتها را تشخیص میدهند، تصاویر را بخشبندی کرده و محتوای ویژوال را با عملکرد پیشرفته تولید میکنند.
شما با اطمینان درباره معماریهایی مانند ResNet و YOLO و U-Net و ترنسفرمرهای بینایی و DETR و SAM در مصاحبههای فنی شرکتهایی مانند گوگل، Tesla و آزمایشگاههای پیشروی هوش مصنوعی صحبت خواهید کرد.
شما سیستمهای واقعی را با استفاده از TensorFlow و PyTorch و شیوههای مدرن MLOps مستقر خواهید کرد.
شما یک پورتفولیو شامل بیش از 7 پروژه مرتبط با صنعت خواهید داشت که تخصص شما را در سراسر پایپلاین کامل بینایی کامپیوتری نشان میدهد.
شما زبان فنی مهندسان CV را خواهید آموخت و تفاوتهای میان دقت و سرعت، پیچیدگی مدل و نیازهای استقرار را درک خواهید کرد.
تحول شما از همین حالا آغاز میشود
از دستکاری پیکسل تا generative AI شما به کل این پایپلاین مسلط خواهید شد. انقلاب ویژوال با شما یا بدون شما در حال رخ دادن است. تنها پرسش این است: آیا شما سازنده آن خواهید بود یا فقط از دور تماشا میکنید؟
همین امروز در دوره شرکت کرده و از یک یادگیرنده کنجکاو به یک مهندس مطمئن بینایی کامپیوتری تبدیل شوید.
این دوره شامل 34 ساعت محتوای ویدئویی، نمایشهای عملی کدنویسی و بیش از 7 پروژه کامل است.
به دانشجویانی بپیوندید که با این مسترکلاس جامع بینایی کامپیوتری، مسیر شغلی خود را متحول کردهاند. سفر شما از مبتدی تا مهندس حرفهای بینایی کامپیوتری همینجا آغاز میشود.
این دوره برای چه کسانی مناسب است؟
- Gemini گفت این دوره برای طیف متنوعی از متخصصان و افراد مشتاق طراحی شده است؛ از دانشجویان و فارغالتحصیلان تازهواردی که میخواهند در AI و بینایی کامپیوتری تخصص پیدا کنند تا در بازار رقابتی به نقشهای پردرآمد دست یابند.
- این دوره همچنین برای توسعهدهندگان نرمافزار، مهندسان و دانشمندان داده که میخواهند شکاف میان برنامهنویسی سنتی و یادگیری عمیق را پر کنند و مهارتهای خود را به پردازش تصویر و تحلیل داده ویژوال گسترش دهند، بسیار مناسب است.
- افرادی که از توسعه وب یا سایر حوزههای فنی به مسیر شغلی جدیدی وارد میشوند، و نیز پژوهشگران و دانشگاهیانی که نیاز دارند مدلهای نظری را به نمونههای عملی تبدیل کنند، این برنامه درسی مهارتهای لازم برای پیادهسازی عملی را فراهم میکند.
- علاوه بر این، کارآفرینان و مدیران محصول که استارتاپهای مبتنی بر بینایی میسازند، پایه فنی لازم برای محصولات دارای تشخیص و شناسایی آبجکت را به دست خواهند آورد.
- در نهایت، مهندسان یادگیری ماشین که میخواهند معماریهای پیشرفته مانند ترنسفرمرهای بینایی را به خوبی یاد بگیرند و علاقهمندان به هوش مصنوعی که مشتاق درک مکانیسم ماشینهای خودران و تولید تصویر هستند، بینشهای عمیقی را که برای ساخت این فناوریها از پایه نیاز دارند، پیدا خواهند کرد.
تسلط به بینایی کامپیوتری - از پیکسل تا تشخیص تا Gen-CV
-
ماژول 1 - اصول بینایی کامپیوتری و پردازش تصویر 03:32
-
مقدمهای بر بینایی کامپیوتری - اهداف یادگیری 04:03
-
مقدمهای بر بینایی کامپیوتری 10:52
-
بینایی کامپیوتری چیست؟ 05:20
-
شکاف سمانتیک - چالش اصلی بینایی کامپیوتری 07:19
-
توضیح مثال کد 03:35
-
تکامل بینایی کامپیوتری 08:15
-
تشخیص لبه Sobel 06:15
-
تشخیص لبه Canny 03:13
-
توضیح مثال کد 03:37
-
استخراج ویژگیهای HoG 07:13
-
تشخیص ویژگیهای SIFT 04:11
-
توضیح مثال کد 04:17
-
طبقهبندهای یادگیری ماشین روی ویژگیهای آموخته شده 03:22
-
آموزش ماشینهای بردار پشتیبان (SVM) 04:41
-
آموزش نزدیکترین همسایه k (KNN) 03:34
-
توضیح مثال کد 06:34
-
عصر 2 - عصر یادگیری عمیق 05:33
-
عصر Generative AI 03:37
-
گردشکار جهانی بینایی کامپیوتری 02:34
-
توضیح تمرین کد 08:33
-
اصول تصویر دیجیتال - اهداف یادگیری 03:06
-
اصول تصویر دیجیتال 09:40
-
پیکسل - اتم بینایی 06:17
-
تصویر به عنوان ماتریس - واقعیت ریاضی 04:08
-
تصاویر رنگی به صورت ماتریسهای سهبعدی 06:36
-
توضیح مثال کد 05:16
-
فضاهای رنگی - RGB افزایشی 09:18
-
فضاهای رنگی - HSV برای تشخیص قوی 09:41
-
فضاهای رنگی - Grayscale 06:56
-
توضیح مثال کد 05:07
-
عمق تصویر (عمق بیت) 06:31
-
توضیح مثال کد 02:36
-
بینایی کامپیوتری به صورت عملی با OpenCV 04:59
-
توضیح مثال کد 08:01
-
توضیح تمرین کد 07:58
-
تکنیکهای ضروری پیشپردازش تصویر - اهداف یادگیری 03:54
-
پیشپردازش تصویر 07:13
-
تبدیل تصویر 03:26
-
توضیح مثال کد 02:18
-
تبدیلات هندسی 05:22
-
تبدیل هندسی - بخش 1 - مقیاسبندی 04:32
-
تبدیل هندسی - بخش 2 - چرخش و انتقال 03:34
-
تبدیلات هندسی OpenCV به صورت عملی 03:30
-
توضیح مثال کد 03:36
-
تبدیل هندسی - بخش 3 - آفین در برابر پرسپکتیو 06:21
-
توضیح مثال کد 02:30
-
ریاضیات تبدیلات هندسی 05:33
-
تنظیمات فوتومتریک - فیکس کردن نور و کنتراست 04:00
-
تنظیمات فوتومتریک - همسانسازی هیستوگرام 04:18
-
توضیح مثال کد 03:49
-
فیلترینگ - جادوی کانولوشن 06:33
-
کرنلها - فیلترهای دستساز برای بینایی 02:54
-
توضیح مثال کد 03:06
-
عملی - پیشپردازش برای تشخیص چهره 06:08
-
توضیح مثال کد 06:22
-
توضیح تمرین کد 12:25
-
ماژول 2 - اصول یادگیری عمیق و شبکههای عصبی کانولوشن (CNN) - مقدمه 02:16
-
از پرسپترونها تا شبکههای عصبی عمیق - اهداف یادگیری 04:14
-
تاریخچه بینایی کامپیوتری - 1950 تا دهه 1990 05:39
-
عصر مدرن بینایی کامپیوتری - از دهه 1990 تا امروز 04:44
-
توضیح مثال کد 07:01
-
ریاضیات کامل از لایه ورودی تا اولین لایه پنهان 09:42
-
تابع فعالسازی 05:50
-
لایه پنهان 2 شبکه عصبی 04:47
-
ریاضیات کامل نورون لایه خروجی 04:11
-
انواع لایهها و نقشهای آنها 03:00
-
توضیح مثال کد 07:01
-
فرآیند یادگیری دو مرحلهای - گذر رو به جلو 05:33
-
آنتروپی متقاطع برای طبقهبندی باینری 06:58
-
آنتروپی متقاطع برای طبقهبندی چندکلاسه 06:09
-
گذر رو به عقب - یادگیری از اشتباهات 09:37
-
نزول گرادیان 05:26
-
توضیح مثال کد 06:16
-
فرآیند یادگیری دو مرحلهای - خلاصه 07:20
-
هایپرپارامتر نرخ یادگیری و نقش Optimizer 03:46
-
توضیح مثال کد 03:33
-
توضیح تمرین کد 14:57
-
معماری CNN - اهداف یادگیری 03:05
-
چرا DNNs در تسکهای بینایی کامپیوتری شکست میخورند؟ 10:51
-
توضیح مثال کد 05:51
-
درک شبکههای عصبی کانولوشن (DNNs) 08:45
-
عملیات کانولوشن و فرآیند پنجره لغزان 08:57
-
انواع فیلترهای کانولوشن 05:20
-
Strides و padding 13:48
-
توضیح مثال کد 04:12
-
فعالسازی ReLU و MaxPooling 06:26
-
فعالسازی ReLU - درک مفهومی 06:23
-
Pooling - درک مفهومی 05:20
-
توضیح مثال کد 03:21
-
مثال CNN دو لایهای 01:04
-
لایه متراکم یا کاملاً متصل و لایه خروجی 05:36
-
اتصالپذیری محلی و اشتراکگذاری وزن در CNN 02:26
-
تغییرناپذیری ترجمه و ساخت ویژگی سلسلهمراتبی 03:54
-
توضیح مثال کد 05:00
-
توضیح تمرین کد 15:14
-
ساخت اولین CNN خود - اهداف یادگیری 03:41
-
هدف عملی - یک CNN را برای دیدن آموزش دهید 08:55
-
داده - مهمترین عنصر 12:57
-
تانسورها به عنوان ورودی داده و GPU به عنوان شتابدهنده 07:10
-
مزیت PyTorch 05:02
-
توضیح مثال کد 05:35
-
معماری CNN - اولین مدل ما 07:44
-
خروجی لایهبهلایه معماری CNN 02:26
-
توضیح مثال کد2 03:14
-
گذر رو به جلو، پسانتشار و ارزیابی 06:02
-
سهگانه آموزش 05:57
-
استراتژیهای مؤثر آموزش و عیبیابی 05:04
-
حلقه آموزش - جایی که یادگیری واقعاً رخ میدهد 02:28
-
مشکلات رایج و راهحلها 03:59
-
توضیح مثال کد 2.3.3 04:17
-
فراتر از آموزش - مدل ما چقدر خوب است؟ 07:10
-
آموزش CNN - چکلیست 06:18
-
توضیح مثال کد 05:51
-
توضیح تمرین کد 12:36
-
ماژول 3 - معماریهای پیشرفته CNN و یادگیری انتقالی - مقدمه 02:32
-
معماریهای لندمارک CNN - اهداف درس 03:41
-
معماریهای CNN - بررسی LeNet-5 (1998) 12:14
-
تکامل معماریهای لندمارک CNN 04:34
-
AlexNet (2012) 08:56
-
توضیح مثال کد 01:38
-
VGGNet (2014) 07:43
-
ResNet (2015) 12:32
-
توضیح مثال کد 06:22
-
Inception (GoogLeNet) 2014 10:47
-
DenseNet 2017 07:31
-
EfficientNet (2019) 11:06
-
چگونه معماری مناسب (ستون فقرات) CNN را انتخاب کنیم؟ 02:46
-
یادگیری انتقالی و فاین تیونینگ - اهداف یادگیری 03:23
-
دو رویکرد - یادگیری انتقالی و فاین تیونینگ 08:48
-
انگیزه - چرا مدلهای از پیش آموزش دیده را دوباره استفاده کنیم؟ 09:34
-
استخراج ویژگی - انتخاب مطمئن 06:13
-
مکانیسم - چگونه استخراج ویژگی را پیادهسازی کنیم؟ 04:10
-
توضیح مثال کد 11:04
-
فاین تیونینگ - شرطبندی روی عملکرد بالا 09:45
-
گام جریان گرادیان 08:20
-
نرخهای یادگیری تفاضلی - کلید آموزش موفق 06:45
-
Elastic Weight Consolidation (EWC) 06:48
-
توضیح مثال کد 09:29
-
درک CNNs - از پیکسلها تا آموزش پیشرفته 02:51
-
نکات حرفهای برای آموزش موفق مدل در بینایی کامپیوتری 01:42
-
گردشکار عملی از صفر تا حرفهای 06:01
-
توضیح مثال کد 05:44
-
بهبود عملکرد مدل CNN - اهداف یادگیری 03:43
-
تشخیص مسئله - بیشبرازش (واریانس بالا) 07:52
-
تشخیص مسئله - کمبرازش (بایاس بالا) 06:09
-
دو روش برای بهبود عملکرد مدل 02:04
-
بهبود عملکرد مدل - استحکام و تعمیمپذیری 04:44
-
توضیح مثال کد 05:15
-
افزایش داده - چگونه و چرا؟ 02:31
-
افزایش داده - تا وقتی به نتیجه برسید، شبیهسازی کنید 05:24
-
افزایش داده - ابزارهای هندسی 05:31
-
افزایش داده - ابزارهای فوتومتریک و MixUp 05:57
-
توضیح مثال کد 05:10
-
منظمسازی برای مهار مدل - Dropout 11:24
-
Weight Decay (منظمسازی لایه 2) 05:55
-
هموارسازی برچسب - مقابله با بیشاعتمادی 06:10
-
توضیح مثال کد 12:48
-
اثر همافزایی - افزایش داده و منظمسازی 01:22
-
جمعبندی 05:17
-
توضیح مثال کد 07:15
-
ماژول 4 - تشخیص آبجکت با یادگیری عمیق - مقدمه 04:54
-
مقدمهای بر تشخیص آبجکت - اهداف درس 03:33
-
مقدمهای بر تشخیص آبجکت 10:12
-
تعریف تسک - چه چیزی و کجا؟ 04:07
-
ساختار خروجی تشخیص 06:10
-
توضیح مثال کد - بخش 1 05:25
-
مثال ویژوال - Intersection روی Union (IoU) در عمل 03:15
-
متریکهای Intersection روی Union (IoU) 03:52
-
خوب، بد و زشت - مقادیر IoU 04:00
-
توضیح مثال کد - بخش 2 05:19
-
موازنه دقت و بازیابی و نمایش هندسی mAP 04:19
-
محاسبه گامبهگام میانگین متوسط دقت (mAP) 07:08
-
تفسیر مقادیر میانگین متوسط دقت (mAP) 04:20
-
توضیح مثال کد - بخش 3 05:31
-
سرکوب غیرحداکثری 06:07
-
سرکوب غیرحداکثری (NMS) - توضیح با یک مثال 03:09
-
تشخیص آبجکت - پایپلاین سطح بالا 07:06
-
توضیح مثال کد - بخش 4 07:17
-
آشکارسازهای دو مرحلهای (خانواده R-CNN) - اهداف یادگیری 03:55
-
رویکرد و تکامل آشکارسازهای دو مرحلهای 02:48
-
آشکارسازهای دو مرحلهای - خانواده R-CNN 08:26
-
توضیح مثال کد - بخش 1 04:38
-
R-CNN (2014) و مسئله 13:06
-
Fast R-CNN (2015) - توضیح با یک مثال 02:14
-
Fast R-CNN (2015) - مغز مشترک 07:34
-
توضیح مثال کد - بخش 2 03:47
-
R-CNN (2015) سریعتر - نوآوری شبکه پیشنهاد ناحیه (RPN) 04:10
-
R-CNN (2015) سریعتر - استاندارد مدرن 05:25
-
R-CNN (2015) سریعتر - پایپلاین کامل 04:03
-
مقایسه خانواده R-CNN - تکامل 04:15
-
توضیح مثال کد - بخش 3 09:34
-
آشکارسازهای تکمرحلهای (YOLO و SSD) - اهداف یادگیری 03:51
-
گذار از آشکارساز آبجکت دو مرحلهای به تکمرحلهای 09:16
-
انقلاب رگرسیون در برابر پیشنهاد 05:15
-
تفاوتهای ریاضی و عملی R-CNN و YOLO 06:06
-
توضیح مثال کد - بخش 1 03:58
-
YOLO - فقط یکبار نگاه کنید 10:43
-
ریاضیات تابع ضرر YOLO 05:51
-
محدودیتهای مدل YOLO نسخه 1 06:29
-
توضیح مثال کد - بخش 2 08:14
-
SSD - هرم ویژگی چندمقیاسی 06:22
-
SSD - انکر باکسها (باکسهای پیشفرض) 07:43
-
توضیح مثال کد - بخش 3 06:04
-
مقایسه آشکارسازها و راهنمایی عملی 06:03
-
توضیح مثال کد - بخش 4 05:50
-
معماریهای مدرن - آشکارسازهای end-to-end (DETR) - اهداف یادگیری 03:23
-
معماریهای مدرن - آشکارسازهای end-to-end (DETR) 11:54
-
روش مدل ترنسفرمر تشخیص (DETR) 03:17
-
نوآوری اصلی - ترنسفرمرها در بینایی 12:19
-
توضیح مثال کد - بخش 1 06:47
-
پایپلاین DETR - بخش 1 - ستون فقرات 12:05
-
پایپلاین DETR - بخش 2 - رمزگذار ترنسفرمر 10:12
-
پایپلاین DETR - بخش 3 - رمزگشا و پیشبینیها 07:44
-
پایپلاین DETR - بخش 4 - FFNs پیشبینی 02:34
-
توضیح مثال کد - بخش 2 04:47
-
گردشکار کامل DETR 04:55
-
راز اصلی - ضرر تطبیق دوجهتی 07:53
-
DETR در برابر جهان - یک پارادایم شیفت 06:38
-
توضیح مثال کد - بخش 3 03:18
-
ماژول 5 - بخشبندی تصویر با یادگیری عمیق - مقدمه 02:43
-
ماژول 5 - بخشبندی تصویر با یادگیری عمیق - مقدمه 02:49
-
بخشبندی سمانتیک در برابر بخشبندی نمونه 05:54
-
هدف طبقهبندی در سطح پیکسل 09:37
-
توضیح مثال کد - بخش 1 03:03
-
معماری بخشبندی سمانتیک 03:10
-
بخشبندی سمانتیک - موارد لازم 05:52
-
بینش ریاضیاتی (ضرر پیکسلی) 06:47
-
توضیح مثال کد - بخش 2 03:56
-
معماری بخشبندی نمونه 02:07
-
بخشبندی نمونه - موارد لازم 08:59
-
بینش ریاضیاتی - ضرر هیبریدی چندتسکی 06:34
-
توضیح مثال کد - بخش 3 04:05
-
معماریهای بخشبندی سمانتیک (FCN و U-Net) - اهداف یادگیری 04:38
-
تکامل معماری بخشبندی سمانتیک 05:54
-
مسئله اصلی - از برچسب کلی تا نقشه پیکسل 03:30
-
راهحل معماریها 02:23
-
توضیح مثال کد - بخش 1 03:27
-
طراحی رمزگذار و رمزگشا - بخش 1 - رمزگذار 05:49
-
طراحی رمزگذار و رمزگشا - بخش 2 - رمزگشا 07:22
-
توضیح مثال کد - بخش 2 03:23
-
روش شبکه کاملاً کانولوشن 01:26
-
طراحی شبکه کاملاً کانولوشن 05:07
-
مشکل گلوگاه و راهحل اتصال میانبر 03:45
-
توضیح مثال کد - بخش 3 03:24
-
روش بخشبندی سمانتیک U-Net 01:21
-
U-Net با دقت جراحی (2015) 01:58
-
چرا الحاق بهتر است؟ 04:44
-
FCN در برابر U-Net و کاربردهای واقعی 04:59
-
توضیح مثال کد - بخش 4 09:32
-
معماریهای بخشبندی نمونه (Mask R-CNN) - اهداف یادگیری 02:39
-
معماریهای بخشبندی نمونه (Mask R-CNN) 09:10
-
گسترش معماری R-CNN سریعتر با Mask Head 04:15
-
ترفند دیکوپلینگ - ماسکهای مستقل از کلاس 06:06
-
توضیح مثال کد - بخش 1 07:29
-
مشکل - خطای کوانتیزاسیون در ROI Pooling 03:47
-
راهحل - همسویی ROI 04:27
-
مکانیسم ریاضیات پشت Mask R-CNN 04:50
-
توضیح مثال کد - بخش 2 04:53
-
مدلهای بنیادین برای بخشبندی (SAM) - اهداف یادگیری 02:49
-
SAM به عنوان لحظه GPT برای تصاویر 01:48
-
مدلهای بنیادین برای بخشبندی (SAM) 05:14
-
گذار از متخصصان به همهفنحریفها 03:12
-
توضیح مثال کد - بخش 1 03:40
-
بررسی معماری SAM 02:12
-
معماری SAM - بخش 1 - رمزگذار تصویر 05:29
-
معماری SAM - بخش 2 - رمزگذار پرامپت (مترجم) 05:50
-
معماری SAM - بخش 3 - رمزگشای ماسک (هنرمند) 03:45
-
توضیح مثال کد - بخش 2 04:55
-
معماری و تکامل SAM 2 05:23
-
معماری و تکامل SAM 3 06:10
-
مقایسه SAM در برابر SAM 2 در برابر SAM 3 و کاربردهای واقعی 04:30
-
توضیح مثال کد - بخش 3 03:43
-
ماژول 6 - مدلهای مولد و فراتر از CNNs - مقدمه 04:18
-
خودرمزگذارها (AEs) و خودرمزگذارهای متغیر (VAEs) - اهداف یادگیری 04:41
-
خودرمزگذارها در برابر خودرمزگذارهای متغیر 10:08
-
فضای محیطی (آشوب)، منیفولد و فضای نهفته 05:41
-
هسته Gen AI - منیفولد، فضای نهفته و خودرمزگذارها 06:05
-
رمزگشا - از بلوپرینت تا بازگشت به تصویر 05:27
-
توضیح مثال کد - بخش 1 03:47
-
بررسی معماری خودرمزگذار (AE) 02:11
-
پیادهسازی خودرمزگذار و محدودیتها 04:37
-
تابع ضرر خودرمزگذار 06:44
-
توضیح مثال کد - بخش 2 04:40
-
بررسی معماری خودرمزگذارهای متغیر (VAE) 02:25
-
خودرمزگذارهای متغیر - انقلاب احتمالاتی 04:05
-
ترفند پارامتردهی مجدد در بینایی کامپیوتری مولد (VAE) 05:52
-
درک زیان VAE و تقابل AE با VAE 05:01
-
توضیح مثال کد - بخش 3 06:42
-
مقایسه AE و VAE 06:53
-
نمایشهای گسستهسازی شده β-VAE 05:21
-
VAE شرطی (cVAE) 06:04
-
کاربردهای واقعی AEs و VAEs 04:05
-
توضیح مثال کد - بخش 4 04:51
-
شبکههای مولد متخاصم (GANs) - اهداف یادگیری 05:43
-
شبکههای مولد متخاصم (GANs) 10:28
-
حلقه آموزش GAN - مسیر رسیدن به تعادل Nash 06:24
-
موتور ریاضیات - بازی Minimax 05:40
-
توضیح مثال کد - بخش 1 05:41
-
معماری DCGAN - نقشه راه برای GANs پایدار 11:10
-
Choreography آموزش GAN - بخش 1 - آموزش Discriminator 05:06
-
Choreography آموزش GAN - بخش 2 - آموزش مولد 03:23
-
Choreography کامل آموزش 03:06
-
توضیح مثال کد - بخش 2 07:56
-
چالشهای GAN - فروپاشی حالت و محوشدگی گرادیان 03:54
-
راهحل - Wasserstein GAN (WGAN) 05:33
-
مزایای WGAN و جزئیات پیادهسازی 02:16
-
توضیح مثال کد - بخش 3 06:27
-
معماری StyleGAN - سنتز گسستهسازی شده 05:34
-
معماریهای پیشرفته GAN - بررسی StyleGAN 04:10
-
CycleGAN - ترجمه تصویر به تصویر بدون جفت 02:21
-
ترجمه با CycleGAN بدون داده جفت شده 05:17
-
ارزیابی متریکهای GAN بدون نظارت 06:58
-
توضیح مثال کد - بخش 4 05:13
-
مقدمهای بر ترنسفرمرهای بینایی (ViT) - اهداف یادگیری 05:01
-
ترنسفرمرهای بینایی (ViT) - پارادایم شیفت 06:14
-
معماری ترنسفرمرهای بینایی (ViT) 07:58
-
چرا بینایی به دیدی جهانی نیاز دارد؟ 08:18
-
CNN در برابر ViT - داستان دو دیدگاه 03:22
-
توضیح مثال کد - بخش 1 04:43
-
موتور بینایی - توضیح self-attention 04:09
-
self-attention و multi-head attention 06:44
-
از پیکسلها تا توکنها - فرآیند patching در ViT 04:05
-
گام 1 - مسطحسازی Patches به تعبیه توکنها 05:49
-
پایپلاین کامل 03:23
-
گام 2 - پروجکشن خطی از پیکسلها به واژههای ویژوال 05:02
-
توضیح مثال کد - بخش 2 08:34
-
گام 3 - انکودینگ مکانی حافظه فضایی بینایی 09:01
-
گام 4 - رمزگذار ترنسفرمر هسته پردازش 08:00
-
نرمالسازی لایهای، MLP و اتصالات باقیمانده 07:34
-
توضیح مثال کد - بخش 3 06:36
-
Energy Landscape-Aware ViT (ELA-ViT) 03:11
-
ترنسفرمر بینایی Hypergraph (HgVT) 02:47
-
نوآوریهای ترنسفرمر بینایی در 2025 04:09
-
ترنسفرمر تصویر Data-efficient (DeiT) 09:47
-
ترنسفرمر Swin - بررسی ترنسفرمر بینایی سلسلهمراتبی 08:01
-
توضیح مثال کد - بخش 4 03:20
-
تعبیههای ویژوال و جستجوی تصویر - اهداف یادگیری 02:47
-
درک مدلهای تعبیه در بینایی کامپیوتری مولد 04:55
-
تعبیههای ویژوال و جستجوی تصویر - نقشه تصاویر 09:23
-
از پیکسلها تا بردارهای سمانتیک - پایپلاین تعبیه 07:52
-
پیشپردازش تصویر در بینایی کامپیوتری مولد - تغییر اندازه و نرمالسازی 01:57
-
نهاییسازی تعبیه - پروجکشن و نرمالسازی 06:54
-
نرمالسازی لایه 2 و رزونانس با شباهت کسینوسی 04:00
-
توضیح مثال کد - بخش 1 05:23
-
SimCLR - یادگیری نمایشهای ویژوال از Views افزوده شده 02:00
-
یادگیری تطبیقی با SimCLRTeaching 05:49
-
Triplet Loss در شناسایی چهره 06:11
-
جستجوی کارآمد - یافتن یک تصویر در میان میلیاردها تصویر 05:39
-
استراتژیهای ایندکسگذاری FAISS 03:38
-
توضیح مثال کد - بخش 2 03:23
-
ایندکس فایل وارونه (IVF) برای جستجوی کارآمد 08:57
-
ایندکس کوانتیزاسیون محصول (PQI) برای جستجوی کارآمد 10:37
-
Hierarchical Navigable Small World (HNSW) برای جستجوی کارآمد 02:39
-
توضیح مثال کد - بخش 3 06:49
-
کاربرد 1 - جستجوی معکوس تصویر 04:59
-
شناسایی چهره و ArcFace 03:33
-
معماری دو رمزگذار CLIP 02:38
-
کاربرد جستجوی چندوجهی با CLIP 01:27
-
توضیح مثال کد - بخش 4 03:30
مشخصات آموزش
تسلط به بینایی کامپیوتری - از پیکسل تا تشخیص تا Gen-CV
- تاریخ به روز رسانی: 1405/04/02
- سطح دوره:Alls
- تعداد درس:360
- مدت زمان :34:01:43
- حجم :21.7GB
- زبان:دوبله زبان فارسی
- دوره آموزشی:AI Academy