فاینتیونینگ مدلهای زبانی بزرگ با یادگیری تقویتی به متد GRPO در DeepSeek
✅ سرفصل و جزئیات آموزش
آنچه یاد خواهید گرفت:
- اصول اساسی مدلهای زبان بزرگ (LLMs) و ساختار کلی فرآیندهای آموزش آنها را درک خواهید کرد.
- یاد خواهید گرفت تفاوت بین مدلهای Base و مدلهای Instruct چیست و همچنین با متدهای آمادهسازی داده برای هر یک آشنا خواهید شد.
- تکنیکهای پیشپردازش داده و نکات کلیدی، تشخیص توکنهای خاص مورد نیاز مدلها، فهم فرمتهای داده و متدهای مرتبط را فراخواهید گرفت.
- تجربه عملی و کاربردی در کار با LoRA و Data Collator کسب میکنید و چگونگی کارکرد آنها را بهصورت جزئی مشاهده خواهید کرد.
- درک دقیقی از هایپرپارامترهای مهم در فرآیند آموزش، شامل هدف و عملکرد هرکدام خواهید داشت.
- جزئیات عملی در چگونگی ادغام ماتریسهای آموزشدیده LoRA با مدل پایه، و نکات مهم و بهترین شیوه ها در این مسیر را یاد میگیرید.
- مفهوم Direct Preference Optimization (DPO)، چگونگی کار، فرمت انتظار داده و موارد کاربرد خاص آن را بررسی میکنید.
- نکات مهم در آمادهسازی داده برای DPO، و چگونگی عملکرد Data Collator در این فرآیندها را میآموزید.
- هایپرپارامترهای خاص در آموزش DPO، نقش و عملکرد هرکدام را بررسی میکنید.
- چگونگی بارگذاری مدلهای آموزشدیده در پلتفرمهایی مانند Hugging Face و مدیریت مؤثر هایپرپارامترها پس از آموزش را یاد میگیرید.
- بهصورت جامع خواهید آموخت که روش یادگیری تقویتی Group Relative Policy Optimization (GRPO) چگونه کار میکند و درک عمیقی از سازوکار یادگیری آن بهدست خواهید آورد.
- چگونگی آمادهسازی داده مخصوصاً برای GRPO را تمرین میکنید.
- یاد خواهید گرفت چگونه داده را بهطور خاص برای روش Group Relative Policy Optimization (GRPO) آمادهسازی کنید.
- یاد خواهید گرفت چگونه توابع پاداش را - که مهمترین بخش در Group Relative Policy Optimization (GRPO) هستند - از طریق مثالهای عملی مختلف طراحی کنید.
- خواهید آموخت داده باید با چه قالبی به توابع پاداش GRPO داده شوند و چگونه میتوان این دادهها را در داخل این توابع پردازش کرد. این جزئیات را بهطور کامل یاد خواهید گرفت.
- یاد خواهید گرفت چگونه پاداشها را در داخل توابع تعریف کنید و قالبهای واضحی برای پاداشدهی در GRPO ایجاد نمایید.
- بهصورت عملی با جزئیات زیادی آشنا خواهید شد؛ مانند استخراج بخشهایی از پاسخ خام که شایسته دریافت پاداش هستند و تعریف پاداش بر اساس این بخشهای استخراجشده.
- یاد خواهید گرفت چگونه با استفاده از GRPO (Group Relative Policy Optimization) یک مدل Instruct را به مدلی تبدیل کنید که قادر به تولید زنجیره استدلال باشد.
پیش نیازهای دوره
- دانش اولیه از برنامهنویسی پایتون
- آشنایی مقدماتی با مفاهیم هوش مصنوعی و یادگیری ماشین
- ترجیحاً سابقه قبلی در کار با Jupyter Notebook یا Google Colab
توضیحات دوره
در این دوره، وارد دنیای مدلهای زبان بزرگ (LLMs) میشوید و متدهای بهینهسازی اساسی و پیشرفته در قالب پایانتاپایان را فراخواهید گرفت. ابتدا با رویکرد SFT (Supervised Fine-Tuning) آشنا میشوید، جایی که یاد میگیرید چگونه داده خود را بهدرستی آماده کنید و مجموعه داده سفارشی با استفاده از tokenizers و data collators را در عمل بسازید. در طول فرآیند SFT، تکنیکهای کلیدی برای کاهش حجم و افزایش کارایی مدلهای بزرگ، با استفاده از LoRA (Low-Rank Adaptation) و کوانتیزاسیون را بررسی میکنید و گام به گام چگونگی ادغام این فناوریها در پروژههای خود را فرا میگیرید.
پس از تثبیت مبانی SFT، به سراغ DPO (Direct Preference Optimization) میروید. این روش به شما امکان میدهد نتایج متمرکز بر کاربر را بهصورت مستقیم از بازخوردهای کاربر در مدل دریافت کنید. چگونگی فرمتبندی داده برای این متد، طراحی مکانیزم پاداش، و چگونگی اشتراکگذاری مدلهای آموزشدیده در پلتفرمهای محبوب مانند Hugging Face را یاد میگیرید. بهعلاوه، درک عمیقتری از چگونگی کار Data Collator در فرآیندهای DPO، تکنیکهای عملی برای آمادهسازی و تبدیل داده در سناریوهای مختلف به دست میآورید.
مرحله مهم دوره، GRPO (Group Relative Policy Optimization) است که روز به روز طرفداران بیشتری پیدا میکند. با GRPO، روشهایی برای بهینهسازی رفتار مدل نه تنها در سطح فردی، بلکه در میان جوامع و گروههای مختلف کاربران یاد میگیرید. این روش را سیستماتیکتر و مؤثرتر در خدمترسانی به گروههای کاربران با نیازهای مختلف میکند. در این دوره، اصول اساسی GRPO را بررسی و بهطور عملی با داده واقعی تجربه خواهید کرد.
در طول دوره، موضوعات کلیدی مانند LoRA، کوانتیزاسیون، SFT ،DPO و بهخصوص GRPO را همراه با تمرینهای پروژهمحور پوشش میدهیم.
در پایان این دوره، شما بهطور کامل قادر خواهید بود تمام مراحل را؛ از آمادهسازی داده بهصورت end‑to‑end گرفته تا فاینتیونینگ مدلها و بهینهسازی سیاست مبتنی بر گروه با اطمینان مدیریت کنید. همچنین توسعهی راهکارهای مدرن و رقابتی مبتنی بر مدلهای زبانی بزرگ (LLM) که هم بر عملکرد بالا و هم بر رضایت کاربر تمرکز دارند، در پروژههای شخصی شما بسیار سادهتر خواهد شد.
این دوره برای چه کسانی مناسب است؟
- دانشمندان داده و مهندسان یادگیری ماشین که میخواهند در تکنیکهای آموزش مدلهای زبانی بزرگ (LLM) تخصص پیدا کنند.
- افرادی که میخواهند به نکات کلیدی و بهترین شیوه ها برای آمادهسازی داده بهطور کامل مسلط شوند.
- توسعهدهندگان هوش مصنوعی که قصد دارند مدلهای زبانی سفارشی خود را بسازند.
- افرادی که میخواهند تجربه عملی با تکنیکهای پیشرفتهای مانند Supervised Fine‑Tuning (SFT) و Direct Preference Optimization (DPO) و Group Relative Policy Optimization (GRPO) به دست آورند.
- افرادی که میخواهند تجربه عملی و کاربردی با تکنیک Group Relative Policy Optimization (GRPO) داشته باشند.
- افرادی که میخواهند نکات ضروری آمادهسازی داده را یاد بگیرند و مجموعهدادهه سفارشی خود را برای مدلهای زبانی تطبیق دهند.
- کسانی که به متدهای یادگیری تقویتی و بهینهسازی مدلها بر اساس بازخورد کاربران علاقهمند هستند.
فاینتیونینگ مدلهای زبانی بزرگ با یادگیری تقویتی به متد GRPO در DeepSeek
-
مقدمه 01:15
-
معرفی محتوای دوره 07:18
-
کوانتیزاسیون چیست؟ چگونه بر اندازه و پارامترهای مدل تأثیر میگذارد؟ 04:08
-
ساخت حساب کاربری در Hugging Face و دریافت توکن 03:45
-
ساخت نوتبوک در Colab و آشنایی با کتابخانهها 03:24
-
دانلود مدل با کوانتیزاسیون 04:56
-
تفاوتهای بین مدلهای Base و Instruct 06:46
-
دانلود و بررسی مجموعه داده 03:44
-
آمادهسازی مجموعه داده، قالب چت و ادغام توکنهای سفارشی 11:41
-
ادامه تهیه و توکنسازی مجموعه داده 04:45
-
Data Collator چیست؟ چگونه کار میکند؟ مثال عملی 07:45
-
LoRA چیست؟ چرا استفاده میشود؟ 02:46
-
ادغام ماتریسهای LoRA در مدل 06:21
-
تعیین پارامترهای آموزش (هایپرپارامترهای آموزش) 08:10
-
تنظیم Trainer، شروع آموزش و ارزیابی نتایج 03:02
-
ادغام ماتریسهای آموزشدیده LoRA با مدل 05:19
-
بارگذاری مدل در Hugging Face و استفاده از آن 04:53
-
هایپرپارامترهای مؤثر بر خروجیها 05:37
-
دانلود مدل و tokenizer 03:27
-
افزودن توکنهای سفارشی جدید به tokenizer 06:43
-
ایجاد قالبها با توکنهای سفارشی جدید و ادغام آنها در مجموعه داده 06:11
-
DPO چیست؟ چه فرمت دادهای انتظار دارد؟ 05:34
-
دانلود مدل و درک چگونگی عملکرد Data Collator در پدینگ داده 05:11
-
آمادهسازی مجموعه داده برای DPO 08:47
-
اضافه کردن ماتریسهای LoRA به مدل 03:08
-
تنظیم پارامترهای آموزش (با DPOConfig) 04:12
-
آموزش مدل و ادغام ماتریسهای LoRA 05:08
-
مدل «استدلالی» چیست و چگونه کار میکند؟ 03:49
-
GRPO چیست و چگونه اجرا میشود؟ 03:32
-
یعنی چه Unsloth و VLLM؟ + لینک دانلود مدل 05:20
-
بررسی مجموعه داده و مراحل اولیه آمادهسازی 06:01
-
استخراج بخشهای خاص از داده: regex و عملیات گروهی 10:28
-
داده در چه قالبی به توابع پاداش ارسال میشوند؟ 05:36
-
نخستین تابع پاداش 10:44
-
دومین تابع پاداش 05:20
-
سومین تابع پاداش 08:25
-
چهارمین تابع پاداش 05:35
-
هایپرپارامترهای آموزش (همراه با تنظیمات GRPO) 06:06
-
آبجکت Trainer و فرآیند آموزش 01:55
-
جدول نتایج، پاداشها و نمونه خروجیها 03:13
مشخصات آموزش
فاینتیونینگ مدلهای زبانی بزرگ با یادگیری تقویتی به متد GRPO در DeepSeek
- تاریخ به روز رسانی: 1405/04/02
- سطح دوره:همه سطوح
- تعداد درس:40
- مدت زمان :03:40:01
- حجم :1.86GB
- زبان:دوبله زبان فارسی
- دوره آموزشی:AI Academy