دوره آموزشی
دوبله زبان فارسی
مسترکلاس یادگیری تقویتی
✅ سرفصل و جزئیات آموزش
آنچه یاد خواهید گرفت:
- درک مفاهیم کلیدی و کامپوننتهای یادگیری تقویتی (RL)، از جمله MDPs، سیاستها، پاداشها و توابع ارزش
- اعمال الگوریتمهایی مانند SARSA و Q-Learning و REINFORCE و PPO و TRPO و SAC و DQN در پایتون
- استفاده از کتابخانههای مدرن مانند Stable-Baselines3 و TF-Agents برای حل مسائل واقعی با RL
- پیادهسازی متدهای actor‑critic و گرادیان سیاست با شبکههای عصبی
- درک اینکه چگونه یادگیری تقویتی را در محیطهای چند ایجنتی و چندهدفی مورد استفاده قرار دهید.
- ساخت پروژههای end-to-end از جمله مدیریت موجودی، سیستمهای توصیهگر و تخصیص منابع به کمک RL
پیشنیازهای دوره
- درک اولیه از پایتون و Numpy توصیه میشود.
- آشنایی با احتمال، جبر خطی، یا یادگیری ماشین مفید خواهد بود، اما الزامی نیست. دوره از اصول اولیه شروع میشود و به تدریج پیش میرود.
توضیحات دوره
به دوره یادگیری تقویتی خوش آمدید! این دوره برای انتقال شما از مبانی یادگیری تقویتی (RL) تا تکنیکها و کاربردهای پیشرفته طراحی شده است. چه دانشمند داده، محقق، توسعهدهنده نرمافزار یا فرد علاقهمند به هوش مصنوعی باشید، این دوره بینشها و تجربههای عملی ارزشمندی در حوزه RL فراهم میکند.
در این دوره موارد زیر را درک خواهید کرد:
- درک اصول یادگیری تقویتی (RL) - یادگیری درباره کامپوننت های اصلی RL، از جمله ایجنتها، محیطها، اکشن ها، پاداشها و states
- بررسی فرآیندهای تصمیمگیری مارکوف (MDPs) - بررسی مفاهیم سیاستها، توابع ارزش و حل MDPs با استفاده از برنامهنویسی پویا
- حل مسائل سارق چند مسلح - درک اکشنهای حریصانه، نمونهگیری تامپسون و مبادله بین اکتشاف و بهرهبرداری
- تسلط به یادگیری اختلاف زمانی - یادگیری درباره یادگیری تفاوت زمانی، SARSA و Q‑Learning
- یادگیری Q-Learning عمیق - کشف شبکههای Deep Q (DQN) و بازپخش تجربه و شبکههای هدف
- اعمال متدهای گرادیان سیاست - بررسی الگوریتمهایی مانند REINFORCE و Advantage Actor‑Critic (A2C) و Asynchronous Advantage Actor‑Critic (A3C)
- پیادهسازی تکنیکهای پیشرفته - یادگیری درباره بهینهسازی سیاست پروگزیمال (PPO)، بهینهسازی سیاست منطقه اعتماد (TRPO) و موارد دیگر
- درک استراتژیهای تکاملی و الگوریتمهای ژنتیک - آشنایی با این تکنیکهای قدرتمند بهینهسازی
- بررسی RL مبتنی بر مدل - یادگیری درباره برنامهنویسی پویا و الگوریتم Dyna‑Q
- بررسی RL سلسلهمراتبی - مطالعه سیاستهای سلسلهمراتبی، چارچوب گزینهها و تجزیه تابع ارزش MAXQ
- بررسی اکتشاف مبتنی بر کنجکاوی - درک انگیزه درونی در RL و ایجنتهای کنجکاو
- یادگیری متدهای بیزی در RL - مطالعه بهینهسازی بیزی با فرآیندهای گاوسی و نمونهگیری تامپسون
- کشف RL توزیع شده - بررسی معماریهای مقیاسپذیر RL و بازپخش تجربه توزیع شده
- درک یادگیری تقویتی متا - یادگیری درباره یادگیری برای یادگیری و Meta‑RL مبتنی بر گرادیان
- بررسی یادگیری تقویتی چند ایجنتی - مطالعه سیستمهای چند ایجنتی، سناریوهای همکارانه و رقابتی، و الگوریتمهای پیشرفته مانند MADDPG و MAPPO
- تمرکز بر RL ایمن - یادگیری درباره محدودیتهای ایمنی، بهینهسازی سیاست محدود و RL با آگاهی از ریسک
- مطالعه RL معکوس - درک مبانی، کاربردها و شکلپذیری پاداش در RL معکوس
- انجام ارزیابی بدون سیاست - یادگیری درباره بهینهسازی اهمیت، برآوردگرهای دوگانه قوی و متدهای دیگر
- استفاده از تقریب تابع در RL - کشف یادگیری تقریب خطی و نقش شبکههای عصبی در RL
- بهینهسازی با تکنیکهای مبتنی بر مدل متوالی - بررسی بهینهسازی بیزی و فرآیندهای گاوسی در RL
- تعادل اهداف متعدد در RL - مطالعه یادگیری RL چندهدفی و بهینهسازی پارتو
- درک شبکههای Q عمیق متناوب - یادگیری شبکههای عصبی تقویتپذیر حافظه و کاربرد آن در محیطهای جزئی قابل مشاهده
- بررسی شبکههای Implicit Quantile - مطالعه توزیع پایه RL و رگرسیون چندک
- بررسی کنترل اپیزودیک عصبی (NEC) - درک حافظه اپیزودیک در RL و الگوریتم NEC
- پیادهسازی تکرار سیاست با تقریب تابع - یادگیری درباره ارزیابی سیاست تکراری و تکرار سیاستهای کلی
- اعمال RL در حوزههای مختلف - مطالعه کاربرد RL در روباتیک، سیستمهای خودران، امور مالی، مدیریت زنجیره تأمین و بازاریابی
در پایان دوره، درک جامعتری از یادگیری تقویتی خواهید داشت و قادر خواهید بود آن را برای حل مسائل پیچیده در حوزههای مختلف به کار ببرید. به ما بپیوندید و در این حوزه پیشرفته ماهر شوید.
این دوره برای چه کسانی مناسب است؟
- کسی که میخواهد یادگیری تقویتی را از ابتدا یاد بگیرد و آن را در مسائل واقعی به کار گیرد.
- دانشمند داده، مهندس، محقق یا دانشجوی پیشرفته که قصد دارد از هر دو جنبه نظری و عملی به یادگیری تقویتی تسلط یابد.
مسترکلاس یادگیری تقویتی
-
مقدمه 03:13
-
چگونه باید این دوره را مطالعه کنید؟ 06:03
-
برنامه درسی 06:11
-
یادگیری تقویتی چیست؟ 07:32
-
کامپوننتهای یادگیری تقویتی 07:29
-
ملزومات نظریه احتمال 30:28
-
فرآیندهای تصمیمگیری مارکوف 05:24
-
فرآیندهای تصمیمگیری مارکوف - مورد 02:46
-
فرآیندهای تصمیمگیری مارکوف - پایتون 04:31
-
فرآیندهای تصمیمگیری مارکوف - خروجی کد 03:01
-
اصول برنامهنویسی پویا 04:21
-
برنامهنویسی پویا - مورد 02:19
-
برنامهنویسی پویا - مدل ریاضی 02:34
-
برنامهنویسی پویا - کد پایتون 07:23
-
برنامهنویسی پویا - خروجی 01:31
-
توزیعهای احتمال - تئوری 30:28
-
ارزیابی سیاست 13:42
-
الگوریتم ارزیابی سیاست تکراری با پایتون 09:40
-
Blackjack - مقدمه 03:49
-
Blackjack - پایتون 26:36
-
Blackjack - خروجی 06:04
-
SARSA چیست؟ 11:40
-
SARSA - پیادهسازی Taxi 29:04
-
SARSA - Taxi و ویژوال 08:46
-
مقدمه Q-Learning 10:05
-
Frozen Lake 08:00
-
Frozen Lake با پایتون 31:02
-
Cliff Walking با پایتون 33:26
-
تقریب تابع در RL 17:17
-
شبکههای عصبی در یادگیری تقویتی 09:17
-
Reinforce چیست؟ 12:09
-
REINFORCE - پایتون 14:45
-
برآورد مزیت تعمیم یافته (GAE) 11:00
-
برآورد مزیت تعمیم یافته (GAE) - پایتون 13:17
-
Advantage Actor-Critic (A2C) 16:51
-
Asynchronous Advantage Actor-Critic (A3C) 15:16
-
Deterministic Policy Gradient (DPG) 15:11
-
DDPG (Deep Deterministic Policy Gradient) 27:44
-
TD3 (Twin Delayed DDPG) 21:24
-
SAC (Soft Actor-Critic) 09:09
-
مقدمه TRPO 16:09
-
بهینهسازی سیاست منطقه اعتماد (TRPO) - پایتون - بخش 1 13:38
-
بهینهسازی سیاست منطقه اعتماد (TRPO) - پایتون - بخش 2 14:38
-
بهینهسازی سیاست منطقه اعتماد (TRPO) - پایتون - بخش 3 13:09
-
بهینهسازی سیاست منطقه اعتماد (TRPO) - پایتون - بخش 4 08:59
-
TRPO - خروجی 05:05
-
بهینهسازی سیاست پروگزیمال 18:34
-
ME-TRPO 23:22
-
مقدمه DQN 14:16
-
یادگیری تقویتی سلسله مراتبی - مقدمه 23:29
-
HRL با - پایتون - بخش 1 16:40
-
HRL با - پایتون - بخش 2 11:52
-
HRL با پایتون - خروجی 05:01
-
مقدمه 08:56
-
CartPole-v1 - بهینهسازی سیاست پروگزیمال 19:28
-
تبرید شبیهسازی شده - مسئله فروشنده دورهگرد 19:04
-
مقدمه یادگیری تقویتی چند ایجنتی 05:33
-
انواع MARL 08:48
-
آموزش MARL 07:20
-
چالشهای MARL 10:23
-
MARL - بررسی Predator و Prey 18:08
-
MARL - خروجیهای متحرک Predator و Prey 01:45
-
مقدمه MORL 16:43
-
MORL با پایتون - بخش 1 22:05
-
MORL با پایتون - بخش 2 17:47
-
MORL با پایتون - خروجی 12:48
-
CartPole چیست؟ 05:50
-
CartPole با DQN 34:59
-
RL ایمن با پایتون 30:16
-
مقدمه اتخاذ تصمیمگیری متوالی 06:30
-
پروژه SDA با جولیا - بخش 1 19:07
-
مدیریت موجودی پویا - پایتون 27:43
-
برنامهریزی بازار تطبیقی 29:00
-
مدیریت پورتفولیو 26:28
-
قیمتگذاری خطوط هوایی با پایتون - کد 24:55
-
قیمتگذاری خطوط هوایی - خروجی 07:06
-
پروژه SDA با جولیا - بخش 2 11:51
-
Recurrent Replay Distributed DQN (R2D2) با پایتون 18:30
-
C51 21:20
-
یادگیری تقویتی در مدیریت منابع 15:58
-
یادگیری تقویتی در بهینهسازی شبکه - بخش 1 18:29
-
یادگیری تقویتی در بهینهسازی شبکه - بخش 2 07:11
-
یادگیری تقویتی در سیستم توصیهگر 21:24
-
یادگیری تقویتی در مدیریت موجودی 18:55
-
پایان دوره 03:09
مشخصات آموزش
مسترکلاس یادگیری تقویتی
- تاریخ به روز رسانی: 1404/12/10
- سطح دوره:متوسط
- تعداد درس:85
- مدت زمان :20:23:11
- حجم :8.15GB
- زبان:دوبله زبان فارسی
- دوره آموزشی:AI Academy