دوره آموزشی
The Great Courses
دوبله زبان فارسی

یادگیری تقویتی (RL) در سطح دانشگاه: یک بررسی جامع

یادگیری تقویتی (RL) در سطح دانشگاه: یک بررسی جامع

✅ سرفصل و جزئیات آموزش

آنچه یاد خواهید گرفت:

  • یادگیری تقویتی (RL) را از پایه درک کنید (شامل اثبات‌ها و استنتاج‌های مرتبط)
  • تکنیک‌های RL مبتنی بر مدل و بدون مدل را درک کنید.
  • تکنیک‌های بهینه‌سازی RL مبتنی بر مقدار و مبتنی بر گرادیان سیاست را درک کنید.
  • درک کنید چگونه از یادگیری عمیق در ترکیب با یادگیری تقویتی استفاده می‌شود.
  • تکنیک‌های RL برای کنترل اعمال گسسته و پیوسته را درک کنید.
  • یادگیری تقویتی از بازخورد انسانی (RLHF) و از پاداش‌های قابل‌راستی‌آزمایی (RLVR) را درک کنید.
  • درک کنید LLMها چگونه یاد می‌گیرند استدلال کنند و زنجیره‌های افکار ارائه دهند.
  • درک کنید LLMها چگونه آموزش می‌بینند تا از ابزارهای دیگر استفاده کنند و با سایر LLMها و ایجنت‌ها همکاری کنند.

پیش‌نیازهای دوره

  • درک پایه‌ای از احتمال و آمار (برای مثال: توزیع‌ها، میانگین، واریانس و امید ریاضی)
  • جبر خطی و حسابان پایه
  • دانش خوب از شبکه‌های عصبی و یادگیری عمیق (برای مثال: گرادیان کاهشی، پس‌انتشار)

توضیحات دوره

  • این دوره یک بررسی عمیق و جامع از یادگیری تقویتی است. سطح آن در حد دانشگاهی و عمیق است.
  • دوره از پایه‌ترین مفاهیم RL در مسائل ساده و محدود شروع می‌شود و گام‌به‌گام با افزایش پیچیدگی پیش می‌رود. تا به معرفی الگوریتم‌هایی برسد که می‌توانند مسائل پیچیده واقعی را برای اعمال گسسته (برای مثال: LLMها) و پیوسته (برای مثال: رباتیک) حل کنند.
  • این دوره از نظر ریاضی نیز بسیار غنی است. در آن الگوریتم‌ها، اثبات‌ها و استنتاج‌های زیادی معرفی می‌شود. با این حال، رویکرد آن همچنان بسیار شهودی است. برای توضیح هر مفهوم یا ایده، مثال‌های شهودی فراوانی ارائه شده است.
  • با اینکه چند نمونه کد هم وجود دارد، ما هدف اصلی دوره را کدنویسی نمی‌دانیم. تمرکز دوره بسیار بیشتر بر مفاهیم، شهودها و استنتاج‌هاست. کدنویسی عمدتاً برای نمایش و توضیح استفاده می‌شود.
  • این دوره بسیاری از الگوریتم‌های سنتی و SOTA را با جزئیات غنی و رضایت‌بخش پوشش می‌دهد. برخی از الگوریتم‌های مطرح‌ شده در دوره عبارتند از: ارزیابی تکراری سیاست (PE)، تکرار مقدار (VI)، تکرار سیاست (PI)، ارزیابی مونته کارلو، TD(0) و TD(lambda) و TD معکوس TD(lambda) با eligibility traces و SARSA و Q-Learning و Double Q-Learning و Expected SARSA و Deep SARSA و Deep Q-Learning و Deep Double Q-Learning و REINFORCE و A2C و A3C و DDPG و SAC و TRPO، PPO و GRPO و DPO
  • در نهایت، دوره یک بخش مطالعه موردی قابل‌ توجه درباره RL با LLMها دارد. این بخش توضیح می‌دهد که مدل‌های زبانی بزرگ و ایجنت‌های مکامله‌ای چگونه با استفاده از یادگیری تقویتی آموزش می‌بینند تا همسویی بهتری با ترجیحات انسانی داشته باشند، زنجیره‌های افکار تولید کنند، و در ریاضی و کدنویسی بهتر شوند. الگوریتم‌های RLHF و RLVR با جزئیات عمیق پوشش داده شده‌اند.

این دوره برای چه کسانی مناسب است؟

  • دانشجویان دانشگاه که یک دوره جدی یادگیری تقویتی (RL) می‌گذرانند.
  • مهندسان یادگیری ماشین که می‌خواهند درک عمیق‌تری از RL به دست آورند.
  • مهندسان LLM که می‌خواهند سازوکار درونی RLHF و RLVR را درک کنند.

یادگیری تقویتی (RL) در سطح دانشگاه: یک بررسی جامع

  • مقدمه‌ای بر دوره 02:31
  • داستان‌های موفقیت RL 05:53
  • ایجنت RL چیست؟ 10:58
  • state چیست؟ 14:57
  • سیاست چیست؟ 07:13
  • قابلیت مشاهده جزئی 13:18
  • stateهای گسسته و پیوسته 07:43
  • اکشن‌های پیوسته و زمان پیوسته 03:51
  • مدل محیط 15:10
  • ویژگی مارکوف 05:26
  • صورت‌بندی ویژگی مارکوف 06:24
  • MDPs و MRPs و POMDPs 06:52
  • قراردادهای نمادگذاری 14:38
  • اپیزودها 06:05
  • بازگشت تجمعی تنزیل‌ شده G 11:27
  • نکاتی درباره بازگشت G 03:10
  • توابع ارزش state و عمل 13:15
  • استنتاج معادله امید ریاضی بلمن 17:47
  • تبدیل یک MDP به MRP 22:48
  • راه‌حل فرم بسته برای MRP 10:24
  • یک مثال عددی برای راه‌حل فرم بسته یک MRP 22:39
  • معادله امید ریاضی بلمن برای توابع ارزش عمل 14:39
  • نقطه بررسی: تا اینجا چه مواردی را پوشش داده‌ایم؟ 02:29
  • اصطلاحات: ارزیابی، کنترل، برنامه‌ریزی و جستجو 12:17
  • MDPs ناپایا 04:41
  • اکتشاف و بهره‌برداری 03:55
  • سیاست بهینه و توابع ارزش بهینه 14:53
  • معادلات بهینگی بلمن 10:51
  • راه‌حل تکراری معادله امید ریاضی بلمن 06:02
  • کد: مثال عددی برای ارزیابی تکراری سیاست 16:31
  • بررسی قضیه نقطه ثابت Banach 14:15
  • اثبات: عملگر امید ریاضی بلمن یک نگاشت انقباضی است 20:31
  • اثبات: برهان قضیه نقطه ثابت Banach 26:01
  • تکرار مقدار: مقدمه و مثال عددی 23:32
  • اثبات: عملگر بهینگی بلمن یک نگاشت انقباضی است 12:00
  • تکرار سیاست: مقدمه 06:33
  • تکرار سیاست: مثال عددی 30:01
  • اثبات: قضیه بهبود سیاست 24:46
  • نکات: تکرار سیاست در برابر تکرار مقدار 06:49
  • تکرار سیاست تعمیم‌یافته 12:07
  • برنامه‌ریزی پویا 15:54
  • نکات و واریانت‌ها 11:43
  • تحلیل پیچیدگی برای PE و PI و VI 05:11
  • VI: تعداد تکرارهای لازم برای همگرایی 08:09
  • مثال عددی: تکرار سیاست با استفاده از معادلات تابع ارزش عمل 13:57
  • نقطه بررسی 03:26
  • trajectorys 11:03
  • ارزیابی مونته کارلو - الگوریتم پایه 10:36
  • ارزیابی مونته کارلو - الگوریتم تکراری 07:48
  • تفاوت زمانی: TD یک‌مرحله‌ای 13:17
  • یک استنتاج ریاضی متفاوت از هدف TD یک‌مرحله‌ای 08:10
  • مقایسه شهودی: MC در برابر TD 09:45
  • MC در برابر TD: آیا اگر فقط داده محدود داشته باشیم، به یک پاسخ می‌رسیم؟ 13:44
  • کد: اثر انتخاب alpha بر ارزیابی MC و TD 12:19
  • خلاصه مقایسه: MC در برابر TD(0) 06:15
  • بازگشت n-مرحله‌ای و شهود TD(lambda) 13:56
  • TD(lambda): ریاضیات 13:41
  • اثبات: TD(lambda) در مقادیر حدی lambda به TD(0) و MC همگرا می‌شود 24:43
  • شهود: view پشت TD(lambda) 07:30
  • استنتاج: view پشت TD(lambda) 19:14
  • Eligibility Traces: شهود و استنتاج 20:40
  • نقطه بررسی: ارزیابی بدون مدل در برابر ارزیابی DP 03:44
  • ارزیابی بدون مدل توابع ارزش عمل 13:22
  • اصطلاحات: یادگیری درون‌سیاستی، خارج از سیاست، برخط و برون‌خط 17:02
  • کنترل بدون مدل: چارچوب کلی 11:57
  • مثال عددی: چرا اکتشاف برای کنترل بدون مدل درون‌سیاستی ضروری است؟ 23:10
  • اثبات: یک سیاست epsilon-greedy قضیه بهبود سیاست را ارضا می‌کند 11:27
  • الگوریتم کنترل MC 06:06
  • کنترل MC: نکاتی درباره alpha 03:56
  • الگوریتم‌های کنترل SARSA و SARSA n-مرحله‌ای 07:02
  • الگوریتم کنترل SARSA(lambda) 06:02
  • GLIE و شرایط Robbins-Monro 07:16
  • الگوریتم‌های کنترل خارج از سیاست: مقدمه 05:56
  • Q-Learning 17:00
  • نمونه‌گیری اهمیت برای ارزیابی MC 15:35
  • مثال عینی: نمونه‌گیری اهمیت برای ارزیابی MC 13:20
  • نمونه‌گیری اهمیت: TD(0) و TD n-مرحله‌ای 18:43
  • استنتاج رسمی نسبت نمونه‌گیری اهمیت 11:09
  • تضمین‌های همگرایی الگوریتم‌های ارزیابی و کنترل بدون مدل جدولی 03:34
  • RL با تقریب‌زن‌های تابع: مقدمه و پیش‌نیازها 01:11
  • نمایش‌های بردار ویژگی برای states 13:19
  • نمایش‌های بردار ویژگی برای اعمال 10:57
  • تقریب‌زن‌های تابع برای توابع ارزش state و عمل 10:57
  • وزن‌های مشترک: مزایا و معایب 08:40
  • تعریف تابع هدف برای ارزیابی سیاست 06:23
  • ارزیابی MC با شبکه‌های عصبی 09:52
  • نمودار تابع ارزش در برابر نمودار تابع زیان 05:15
  • بازگشت‌های MC با تقریب‌زن‌های خطی تابع 03:33
  • ارزیابی نیمه‌گرادیانی TD(0) با شبکه‌های عصبی 09:51
  • بازگشت n-مرحله‌ای و بازگشت lambda برای ارزیابی سیاست با تقریب تابع 02:58
  • شهود: eligibility traces در دنیای تقریب‌زن‌های تابع 16:27
  • استنتاج ریاضی: eligibility traces در دنیای تقریب‌زن‌های تابع 15:07
  • MC در برابر TD(0) با تقریب تابع: آیا با داده بی‌نهایت به همان ارزیابی می‌رسیم؟ - بخش 1 - MC 08:52
  • MC در برابر TD(0) با تقریب تابع: آیا با داده بی‌نهایت به همان ارزیابی می‌رسیم؟ - بخش 2 - MC 15:07
  • MC در برابر TD(0) با تقریب تابع: آیا با داده بی‌نهایت به همان ارزیابی می‌رسیم؟ - بخش 3 - TD(0) 18:37
  • چرا تقریب‌زن‌های خطی تابع برای ما مهم هستند؟ 13:28
  • شهود ویژوال مسئله اهداف متحرک و تغییر تابع زیان 15:27
  • شبکه‌های هدف ثابت 07:21
  • مثال: یادگیری خارج از سیاست با تقریب‌زن خطی تابع می‌تواند واگرا شود! 26:48
  • مثال نقض Baird: تعریف مسئله 08:00
  • استفاده از برنامه‌ریزی پویا با تقریب‌زن‌های تابع 01:56
  • مثال نقض Baird واگرا می‌شود و یک تعریف گسترده‌تر برای ارزیابی خارج از سیاست 10:46
  • مقایسه: خارج از سیاست: بدون مدل در برابر مبتنی بر مدل و جدولی در برابر تقریب تابع 13:54
  • سه‌گانه مرگبار 05:44
  • معادله بروزرسانی وزن برای ارزیابی تابع ارزش Q 07:02
  • کنترل با تقریب تابع: Deep SARSA 14:50
  • Deep Q-Learning DQN 19:22
  • DQN: مقاله مشهور Atari 05:53
  • نکاتی درباره بازپخش تجربه و بازپخش تجربه اولویت‌دار 15:18
  • Double Q-Learning و سوگیری بیشینه‌سازی - جدولی 17:39
  • Double Deep Q-Learning (DDQN) 02:49
  • روش‌های batch با تقریب‌زن‌های خطی تابع: مقدمه 05:20
  • LSMC: استنتاج فرم بسته 11:49
  • استنتاج فرم بسته LSTD(0) و LSTD(lambda) 10:24
  • LSPI 03:28
  • تضمین‌های همگرایی با تقریب‌زن‌های تابع - کنترل و پیش‌بینی 05:35
  • مقدمه‌ای بر روش‌های گرادیان سیاست 04:18
  • چرا باید سیاست را مستقیماً برآورد کنیم؟ 05:17
  • پارامتردهی یک شبکه عصبی سیاست 04:29
  • مدل‌سازی یک سیاست تصادفی چندمتغیره با اعمال پیوسته به‌صورت یک شبکه عصبی 06:50
  • نکاتی درباره روش‌های مبتنی بر مقدار در برابر مبتنی بر سیاست 04:09
  • State Aliasing و سیاست‌های بهینه تصادفی 08:39
  • مشتق تابع Softmax 08:18
  • قضیه گرادیان سیاست برای bandit چندبازویی (MAB) 15:09
  • مثال عینی و شهود بروزرسانی PG در حالت MAB 12:50
  • خط مبنا، مزیت، و critic در حالت MAB 06:30
  • اثبات: کم‌ کردن خط مبنا جهت گرادیان را تغییر نمی‌دهد (PG و MAB) 03:45
  • bandits زمینه‌ای: مقدمه 04:28
  • قضیه بهبود سیاست برای bandits زمینه‌ای 09:37
  • استنتاج 1: MDP کامل: قضیه بهبود سیاست 17:44
  • استنتاج 2: MDP کامل: معرفی تابع ارزش عمل 17:37
  • استنتاج 3: MDP کامل: معرفی مزیت 06:51
  • الگوریتم REINFORCE 05:58
  • A2C: بررسی actor-critic مبتنی بر مزیت 07:39
  • A3C: بررسی actor-critic غیرهمزمان مبتنی بر مزیت 06:42
  • منظم‌سازی آنتروپی و نکاتی درباره طراحی تابع زیان 08:40
  • DDPG: گرادیان سیاست قطعی عمیق برای کنترل اعمال پیوسته - مقدمه 08:00
  • DDPG: آموزش actor 04:07
  • DDPG: آموزش critic 09:13
  • DDPG: بررسی الگوریتم 03:07
  • SAC: بررسی Soft Actor-Critic - مقدمه 06:35
  • SAC: آموزش actor 11:09
  • SAC: آموزش critic 08:30
  • SAC: بررسی الگوریتم 03:20
  • TRPO: بهینه‌سازی سیاست در ناحیه اطمینان - شهود 08:55
  • TRPO: تابع هدف بهینه‌سازی 08:26
  • معادله واگرایی KL 05:15
  • استنتاج: برآورد تعمیم‌یافته مزیت (GAE) 17:24
  • لامبدا‌ی برش‌ خورده در GAE 05:21
  • PPO: بهینه‌سازی نزدیک‌ سیاست (نسخه جریمه نرم) 08:51
  • PPO: بهینه‌سازی نزدیک‌ سیاست (نسخه CLIP) 10:04
  • PPO: مصورسازی تابع هدف PPO-CLIP 09:25
  • GRPO: بهینه‌سازی نسبی سیاست گروهی 17:03
  • نقطه بررسی 08:40
  • مقدمه: RL برای تیونینگ LLMها - مطالعه موردی 04:56
  • مدل‌های زبانی بزرگ (LLMs) چه هستند؟ 16:27
  • مدل‌سازی LLMs به‌ عنوان ایجنت‌های RL 05:45
  • پیش‌ آموزش LLM چگونه انجام می‌شود؟ 09:19
  • SFT: فاین تیونینگ نظارت‌ شده بر دستورالعمل‌ها 06:13
  • مهندسی پرامپت در برابر RLHF - معرفی مدل پاداش 13:37
  • آموزش مدل پاداش (RLHF و RLAIF) 04:48
  • سوءاستفاده از پاداش 07:07
  • استفاده از PPO برای RLHF 03:45
  • استفاده از GRPO برای RLHF 02:30
  • DPO: بهینه‌سازی مستقیم ترجیحات - مقدمه 05:11
  • DPO: بهینه‌سازی مستقیم ترجیحات - تابع هدف 19:15
  • استدلال، زنجیره‌های افکار، ریاضی و فراخوانی تابع و ایجنت (RLVR) 15:39
  • خلاصه: روند معمول آموزش یک LLM استدلال‌گر 03:36

17,388,800 4,347,200 تومان

مشخصات آموزش

یادگیری تقویتی (RL) در سطح دانشگاه: یک بررسی جامع

  • تاریخ به روز رسانی: 1405/04/12
  • سطح دوره:Alls
  • تعداد درس:168
  • مدت زمان :29:10:34
  • حجم :38.33GB
  • زبان:دوبله زبان فارسی
  • دوره آموزشی:AI Academy

آموزش های مرتبط

  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
1,833,000 366,600 تومان
  • زمان: 02:27:39
  • تعداد درس: 24
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
2,260,000 452,000 تومان
  • زمان: 03:02:02
  • تعداد درس: 14
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
795,000 159,000 تومان
  • زمان: 58:00
  • تعداد درس: 12
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
19,403,000 3,880,600 تومان
  • زمان: 26:02:40
  • تعداد درس: 175
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
8,508,000 1,701,600 تومان
  • زمان: 11:25:13
  • تعداد درس: 94
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
6,100,500 1,220,100 تومان
  • زمان: 08:11:21
  • تعداد درس: 28
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
7,256,500 1,451,300 تومان
  • زمان: 09:44:25
  • تعداد درس: 67
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
3,634,500 726,900 تومان
  • زمان: 04:52:43
  • تعداد درس: 38
  • سطح دوره:
  • زبان: دوبله فارسی

آیا سوالی دارید؟

ما به شما کمک خواهیم کرد تا شغل و رشد خود را افزایش دهید.
امروز با ما تماس بگیرید