دوره آموزشی
دوبله زبان فارسی
یادگیری تقویتی (RL) در سطح دانشگاه: یک بررسی جامع
✅ سرفصل و جزئیات آموزش
آنچه یاد خواهید گرفت:
- یادگیری تقویتی (RL) را از پایه درک کنید (شامل اثباتها و استنتاجهای مرتبط)
- تکنیکهای RL مبتنی بر مدل و بدون مدل را درک کنید.
- تکنیکهای بهینهسازی RL مبتنی بر مقدار و مبتنی بر گرادیان سیاست را درک کنید.
- درک کنید چگونه از یادگیری عمیق در ترکیب با یادگیری تقویتی استفاده میشود.
- تکنیکهای RL برای کنترل اعمال گسسته و پیوسته را درک کنید.
- یادگیری تقویتی از بازخورد انسانی (RLHF) و از پاداشهای قابلراستیآزمایی (RLVR) را درک کنید.
- درک کنید LLMها چگونه یاد میگیرند استدلال کنند و زنجیرههای افکار ارائه دهند.
- درک کنید LLMها چگونه آموزش میبینند تا از ابزارهای دیگر استفاده کنند و با سایر LLMها و ایجنتها همکاری کنند.
پیشنیازهای دوره
- درک پایهای از احتمال و آمار (برای مثال: توزیعها، میانگین، واریانس و امید ریاضی)
- جبر خطی و حسابان پایه
- دانش خوب از شبکههای عصبی و یادگیری عمیق (برای مثال: گرادیان کاهشی، پسانتشار)
توضیحات دوره
- این دوره یک بررسی عمیق و جامع از یادگیری تقویتی است. سطح آن در حد دانشگاهی و عمیق است.
- دوره از پایهترین مفاهیم RL در مسائل ساده و محدود شروع میشود و گامبهگام با افزایش پیچیدگی پیش میرود. تا به معرفی الگوریتمهایی برسد که میتوانند مسائل پیچیده واقعی را برای اعمال گسسته (برای مثال: LLMها) و پیوسته (برای مثال: رباتیک) حل کنند.
- این دوره از نظر ریاضی نیز بسیار غنی است. در آن الگوریتمها، اثباتها و استنتاجهای زیادی معرفی میشود. با این حال، رویکرد آن همچنان بسیار شهودی است. برای توضیح هر مفهوم یا ایده، مثالهای شهودی فراوانی ارائه شده است.
- با اینکه چند نمونه کد هم وجود دارد، ما هدف اصلی دوره را کدنویسی نمیدانیم. تمرکز دوره بسیار بیشتر بر مفاهیم، شهودها و استنتاجهاست. کدنویسی عمدتاً برای نمایش و توضیح استفاده میشود.
- این دوره بسیاری از الگوریتمهای سنتی و SOTA را با جزئیات غنی و رضایتبخش پوشش میدهد. برخی از الگوریتمهای مطرح شده در دوره عبارتند از: ارزیابی تکراری سیاست (PE)، تکرار مقدار (VI)، تکرار سیاست (PI)، ارزیابی مونته کارلو، TD(0) و TD(lambda) و TD معکوس TD(lambda) با eligibility traces و SARSA و Q-Learning و Double Q-Learning و Expected SARSA و Deep SARSA و Deep Q-Learning و Deep Double Q-Learning و REINFORCE و A2C و A3C و DDPG و SAC و TRPO، PPO و GRPO و DPO
- در نهایت، دوره یک بخش مطالعه موردی قابل توجه درباره RL با LLMها دارد. این بخش توضیح میدهد که مدلهای زبانی بزرگ و ایجنتهای مکاملهای چگونه با استفاده از یادگیری تقویتی آموزش میبینند تا همسویی بهتری با ترجیحات انسانی داشته باشند، زنجیرههای افکار تولید کنند، و در ریاضی و کدنویسی بهتر شوند. الگوریتمهای RLHF و RLVR با جزئیات عمیق پوشش داده شدهاند.
این دوره برای چه کسانی مناسب است؟
- دانشجویان دانشگاه که یک دوره جدی یادگیری تقویتی (RL) میگذرانند.
- مهندسان یادگیری ماشین که میخواهند درک عمیقتری از RL به دست آورند.
- مهندسان LLM که میخواهند سازوکار درونی RLHF و RLVR را درک کنند.
یادگیری تقویتی (RL) در سطح دانشگاه: یک بررسی جامع
-
مقدمهای بر دوره 02:31
-
داستانهای موفقیت RL 05:53
-
ایجنت RL چیست؟ 10:58
-
state چیست؟ 14:57
-
سیاست چیست؟ 07:13
-
قابلیت مشاهده جزئی 13:18
-
stateهای گسسته و پیوسته 07:43
-
اکشنهای پیوسته و زمان پیوسته 03:51
-
مدل محیط 15:10
-
ویژگی مارکوف 05:26
-
صورتبندی ویژگی مارکوف 06:24
-
MDPs و MRPs و POMDPs 06:52
-
قراردادهای نمادگذاری 14:38
-
اپیزودها 06:05
-
بازگشت تجمعی تنزیل شده G 11:27
-
نکاتی درباره بازگشت G 03:10
-
توابع ارزش state و عمل 13:15
-
استنتاج معادله امید ریاضی بلمن 17:47
-
تبدیل یک MDP به MRP 22:48
-
راهحل فرم بسته برای MRP 10:24
-
یک مثال عددی برای راهحل فرم بسته یک MRP 22:39
-
معادله امید ریاضی بلمن برای توابع ارزش عمل 14:39
-
نقطه بررسی: تا اینجا چه مواردی را پوشش دادهایم؟ 02:29
-
اصطلاحات: ارزیابی، کنترل، برنامهریزی و جستجو 12:17
-
MDPs ناپایا 04:41
-
اکتشاف و بهرهبرداری 03:55
-
سیاست بهینه و توابع ارزش بهینه 14:53
-
معادلات بهینگی بلمن 10:51
-
راهحل تکراری معادله امید ریاضی بلمن 06:02
-
کد: مثال عددی برای ارزیابی تکراری سیاست 16:31
-
بررسی قضیه نقطه ثابت Banach 14:15
-
اثبات: عملگر امید ریاضی بلمن یک نگاشت انقباضی است 20:31
-
اثبات: برهان قضیه نقطه ثابت Banach 26:01
-
تکرار مقدار: مقدمه و مثال عددی 23:32
-
اثبات: عملگر بهینگی بلمن یک نگاشت انقباضی است 12:00
-
تکرار سیاست: مقدمه 06:33
-
تکرار سیاست: مثال عددی 30:01
-
اثبات: قضیه بهبود سیاست 24:46
-
نکات: تکرار سیاست در برابر تکرار مقدار 06:49
-
تکرار سیاست تعمیمیافته 12:07
-
برنامهریزی پویا 15:54
-
نکات و واریانتها 11:43
-
تحلیل پیچیدگی برای PE و PI و VI 05:11
-
VI: تعداد تکرارهای لازم برای همگرایی 08:09
-
مثال عددی: تکرار سیاست با استفاده از معادلات تابع ارزش عمل 13:57
-
نقطه بررسی 03:26
-
trajectorys 11:03
-
ارزیابی مونته کارلو - الگوریتم پایه 10:36
-
ارزیابی مونته کارلو - الگوریتم تکراری 07:48
-
تفاوت زمانی: TD یکمرحلهای 13:17
-
یک استنتاج ریاضی متفاوت از هدف TD یکمرحلهای 08:10
-
مقایسه شهودی: MC در برابر TD 09:45
-
MC در برابر TD: آیا اگر فقط داده محدود داشته باشیم، به یک پاسخ میرسیم؟ 13:44
-
کد: اثر انتخاب alpha بر ارزیابی MC و TD 12:19
-
خلاصه مقایسه: MC در برابر TD(0) 06:15
-
بازگشت n-مرحلهای و شهود TD(lambda) 13:56
-
TD(lambda): ریاضیات 13:41
-
اثبات: TD(lambda) در مقادیر حدی lambda به TD(0) و MC همگرا میشود 24:43
-
شهود: view پشت TD(lambda) 07:30
-
استنتاج: view پشت TD(lambda) 19:14
-
Eligibility Traces: شهود و استنتاج 20:40
-
نقطه بررسی: ارزیابی بدون مدل در برابر ارزیابی DP 03:44
-
ارزیابی بدون مدل توابع ارزش عمل 13:22
-
اصطلاحات: یادگیری درونسیاستی، خارج از سیاست، برخط و برونخط 17:02
-
کنترل بدون مدل: چارچوب کلی 11:57
-
مثال عددی: چرا اکتشاف برای کنترل بدون مدل درونسیاستی ضروری است؟ 23:10
-
اثبات: یک سیاست epsilon-greedy قضیه بهبود سیاست را ارضا میکند 11:27
-
الگوریتم کنترل MC 06:06
-
کنترل MC: نکاتی درباره alpha 03:56
-
الگوریتمهای کنترل SARSA و SARSA n-مرحلهای 07:02
-
الگوریتم کنترل SARSA(lambda) 06:02
-
GLIE و شرایط Robbins-Monro 07:16
-
الگوریتمهای کنترل خارج از سیاست: مقدمه 05:56
-
Q-Learning 17:00
-
نمونهگیری اهمیت برای ارزیابی MC 15:35
-
مثال عینی: نمونهگیری اهمیت برای ارزیابی MC 13:20
-
نمونهگیری اهمیت: TD(0) و TD n-مرحلهای 18:43
-
استنتاج رسمی نسبت نمونهگیری اهمیت 11:09
-
تضمینهای همگرایی الگوریتمهای ارزیابی و کنترل بدون مدل جدولی 03:34
-
RL با تقریبزنهای تابع: مقدمه و پیشنیازها 01:11
-
نمایشهای بردار ویژگی برای states 13:19
-
نمایشهای بردار ویژگی برای اعمال 10:57
-
تقریبزنهای تابع برای توابع ارزش state و عمل 10:57
-
وزنهای مشترک: مزایا و معایب 08:40
-
تعریف تابع هدف برای ارزیابی سیاست 06:23
-
ارزیابی MC با شبکههای عصبی 09:52
-
نمودار تابع ارزش در برابر نمودار تابع زیان 05:15
-
بازگشتهای MC با تقریبزنهای خطی تابع 03:33
-
ارزیابی نیمهگرادیانی TD(0) با شبکههای عصبی 09:51
-
بازگشت n-مرحلهای و بازگشت lambda برای ارزیابی سیاست با تقریب تابع 02:58
-
شهود: eligibility traces در دنیای تقریبزنهای تابع 16:27
-
استنتاج ریاضی: eligibility traces در دنیای تقریبزنهای تابع 15:07
-
MC در برابر TD(0) با تقریب تابع: آیا با داده بینهایت به همان ارزیابی میرسیم؟ - بخش 1 - MC 08:52
-
MC در برابر TD(0) با تقریب تابع: آیا با داده بینهایت به همان ارزیابی میرسیم؟ - بخش 2 - MC 15:07
-
MC در برابر TD(0) با تقریب تابع: آیا با داده بینهایت به همان ارزیابی میرسیم؟ - بخش 3 - TD(0) 18:37
-
چرا تقریبزنهای خطی تابع برای ما مهم هستند؟ 13:28
-
شهود ویژوال مسئله اهداف متحرک و تغییر تابع زیان 15:27
-
شبکههای هدف ثابت 07:21
-
مثال: یادگیری خارج از سیاست با تقریبزن خطی تابع میتواند واگرا شود! 26:48
-
مثال نقض Baird: تعریف مسئله 08:00
-
استفاده از برنامهریزی پویا با تقریبزنهای تابع 01:56
-
مثال نقض Baird واگرا میشود و یک تعریف گستردهتر برای ارزیابی خارج از سیاست 10:46
-
مقایسه: خارج از سیاست: بدون مدل در برابر مبتنی بر مدل و جدولی در برابر تقریب تابع 13:54
-
سهگانه مرگبار 05:44
-
معادله بروزرسانی وزن برای ارزیابی تابع ارزش Q 07:02
-
کنترل با تقریب تابع: Deep SARSA 14:50
-
Deep Q-Learning DQN 19:22
-
DQN: مقاله مشهور Atari 05:53
-
نکاتی درباره بازپخش تجربه و بازپخش تجربه اولویتدار 15:18
-
Double Q-Learning و سوگیری بیشینهسازی - جدولی 17:39
-
Double Deep Q-Learning (DDQN) 02:49
-
روشهای batch با تقریبزنهای خطی تابع: مقدمه 05:20
-
LSMC: استنتاج فرم بسته 11:49
-
استنتاج فرم بسته LSTD(0) و LSTD(lambda) 10:24
-
LSPI 03:28
-
تضمینهای همگرایی با تقریبزنهای تابع - کنترل و پیشبینی 05:35
-
مقدمهای بر روشهای گرادیان سیاست 04:18
-
چرا باید سیاست را مستقیماً برآورد کنیم؟ 05:17
-
پارامتردهی یک شبکه عصبی سیاست 04:29
-
مدلسازی یک سیاست تصادفی چندمتغیره با اعمال پیوسته بهصورت یک شبکه عصبی 06:50
-
نکاتی درباره روشهای مبتنی بر مقدار در برابر مبتنی بر سیاست 04:09
-
State Aliasing و سیاستهای بهینه تصادفی 08:39
-
مشتق تابع Softmax 08:18
-
قضیه گرادیان سیاست برای bandit چندبازویی (MAB) 15:09
-
مثال عینی و شهود بروزرسانی PG در حالت MAB 12:50
-
خط مبنا، مزیت، و critic در حالت MAB 06:30
-
اثبات: کم کردن خط مبنا جهت گرادیان را تغییر نمیدهد (PG و MAB) 03:45
-
bandits زمینهای: مقدمه 04:28
-
قضیه بهبود سیاست برای bandits زمینهای 09:37
-
استنتاج 1: MDP کامل: قضیه بهبود سیاست 17:44
-
استنتاج 2: MDP کامل: معرفی تابع ارزش عمل 17:37
-
استنتاج 3: MDP کامل: معرفی مزیت 06:51
-
الگوریتم REINFORCE 05:58
-
A2C: بررسی actor-critic مبتنی بر مزیت 07:39
-
A3C: بررسی actor-critic غیرهمزمان مبتنی بر مزیت 06:42
-
منظمسازی آنتروپی و نکاتی درباره طراحی تابع زیان 08:40
-
DDPG: گرادیان سیاست قطعی عمیق برای کنترل اعمال پیوسته - مقدمه 08:00
-
DDPG: آموزش actor 04:07
-
DDPG: آموزش critic 09:13
-
DDPG: بررسی الگوریتم 03:07
-
SAC: بررسی Soft Actor-Critic - مقدمه 06:35
-
SAC: آموزش actor 11:09
-
SAC: آموزش critic 08:30
-
SAC: بررسی الگوریتم 03:20
-
TRPO: بهینهسازی سیاست در ناحیه اطمینان - شهود 08:55
-
TRPO: تابع هدف بهینهسازی 08:26
-
معادله واگرایی KL 05:15
-
استنتاج: برآورد تعمیمیافته مزیت (GAE) 17:24
-
لامبدای برش خورده در GAE 05:21
-
PPO: بهینهسازی نزدیک سیاست (نسخه جریمه نرم) 08:51
-
PPO: بهینهسازی نزدیک سیاست (نسخه CLIP) 10:04
-
PPO: مصورسازی تابع هدف PPO-CLIP 09:25
-
GRPO: بهینهسازی نسبی سیاست گروهی 17:03
-
نقطه بررسی 08:40
-
مقدمه: RL برای تیونینگ LLMها - مطالعه موردی 04:56
-
مدلهای زبانی بزرگ (LLMs) چه هستند؟ 16:27
-
مدلسازی LLMs به عنوان ایجنتهای RL 05:45
-
پیش آموزش LLM چگونه انجام میشود؟ 09:19
-
SFT: فاین تیونینگ نظارت شده بر دستورالعملها 06:13
-
مهندسی پرامپت در برابر RLHF - معرفی مدل پاداش 13:37
-
آموزش مدل پاداش (RLHF و RLAIF) 04:48
-
سوءاستفاده از پاداش 07:07
-
استفاده از PPO برای RLHF 03:45
-
استفاده از GRPO برای RLHF 02:30
-
DPO: بهینهسازی مستقیم ترجیحات - مقدمه 05:11
-
DPO: بهینهسازی مستقیم ترجیحات - تابع هدف 19:15
-
استدلال، زنجیرههای افکار، ریاضی و فراخوانی تابع و ایجنت (RLVR) 15:39
-
خلاصه: روند معمول آموزش یک LLM استدلالگر 03:36
مشخصات آموزش
یادگیری تقویتی (RL) در سطح دانشگاه: یک بررسی جامع
- تاریخ به روز رسانی: 1405/04/12
- سطح دوره:Alls
- تعداد درس:168
- مدت زمان :29:10:34
- حجم :38.33GB
- زبان:دوبله زبان فارسی
- دوره آموزشی:AI Academy