دوره آموزشی
The Great Courses
دوبله زبان فارسی

فاین‌تیونینگ مدل‌های زبانی بزرگ با یادگیری تقویتی به متد GRPO در DeepSeek

فاین‌تیونینگ مدل‌های زبانی بزرگ با یادگیری تقویتی به متد GRPO در DeepSeek

✅ سرفصل و جزئیات آموزش

آنچه یاد خواهید گرفت:

  • اصول اساسی مدل‌های زبان بزرگ (LLMs) و ساختار کلی فرآیندهای آموزش آن‌ها را درک خواهید کرد.
  • یاد خواهید گرفت تفاوت بین مدل‌های Base و مدل‌های Instruct چیست و همچنین با متدهای آماده‌سازی داده برای هر یک آشنا خواهید شد.
  • تکنیک‌های پیش‌پردازش داده و نکات کلیدی، تشخیص توکن‌های خاص مورد نیاز مدل‌ها، فهم فرمت‌های داده و متدهای مرتبط را فراخواهید گرفت.
  • تجربه عملی و کاربردی در کار با LoRA و Data Collator کسب می‌کنید و چگونگی کارکرد آن‌ها را به‌صورت جزئی مشاهده خواهید کرد.
  • درک دقیقی از هایپرپارامترهای مهم در فرآیند آموزش، شامل هدف و عملکرد هرکدام خواهید داشت.
  • جزئیات عملی در چگونگی ادغام ماتریس‌های آموزش‌دیده LoRA با مدل پایه، و نکات مهم و بهترین شیوه ها در این مسیر را یاد می‌گیرید.
  • مفهوم Direct Preference Optimization (DPO)، چگونگی کار، فرمت انتظار داده و موارد کاربرد خاص آن را بررسی می‌کنید.
  • نکات مهم در آماده‌سازی داده برای DPO، و چگونگی عملکرد Data Collator در این فرآیندها را می‌آموزید.
  • هایپرپارامترهای خاص در آموزش DPO، نقش و عملکرد هرکدام را بررسی می‌کنید.
  • چگونگی بارگذاری مدل‌های آموزش‌دیده در پلتفرم‌هایی مانند Hugging Face و مدیریت مؤثر هایپرپارامترها پس از آموزش را یاد می‌گیرید.
  • به‌صورت جامع خواهید آموخت که روش یادگیری تقویتی Group Relative Policy Optimization (GRPO) چگونه کار می‌کند و درک عمیقی از سازوکار یادگیری آن به‌دست خواهید آورد.
  • چگونگی آماده‌سازی داده مخصوصاً برای GRPO را تمرین می‌کنید.
  • یاد خواهید گرفت چگونه داده‌ را به‌طور خاص برای روش Group Relative Policy Optimization (GRPO) آماده‌سازی کنید.
  • یاد خواهید گرفت چگونه توابع پاداش را - که مهم‌ترین بخش در  Group Relative Policy Optimization (GRPO) هستند - از طریق مثال‌های عملی مختلف طراحی کنید.
  • خواهید آموخت داده‌ باید با چه قالبی به توابع پاداش GRPO داده شوند و چگونه می‌توان این داده‌ها را در داخل این توابع پردازش کرد. این جزئیات را به‌طور کامل یاد خواهید گرفت.
  • یاد خواهید گرفت چگونه پاداش‌ها را در داخل توابع تعریف کنید و قالب‌های واضحی برای پاداش‌دهی در GRPO ایجاد نمایید.
  • به‌صورت عملی با جزئیات زیادی آشنا خواهید شد؛ مانند استخراج بخش‌هایی از پاسخ خام که شایسته دریافت پاداش هستند و تعریف پاداش بر اساس این بخش‌های استخراج‌شده.
  • یاد خواهید گرفت چگونه با استفاده از GRPO (Group Relative Policy Optimization) یک مدل Instruct را به مدلی تبدیل کنید که قادر به تولید زنجیره استدلال باشد.

پیش نیازهای دوره

  • دانش اولیه از برنامه‌نویسی پایتون
  • آشنایی مقدماتی با مفاهیم هوش مصنوعی و یادگیری ماشین
  • ترجیحاً سابقه قبلی در کار با Jupyter Notebook یا Google Colab

توضیحات دوره

در این دوره، وارد دنیای مدل‌های زبان بزرگ (LLMs) می‌شوید و متدهای بهینه‌سازی اساسی و پیشرفته در قالب پایان‌تا‌پایان را فراخواهید گرفت. ابتدا با رویکرد SFT (Supervised Fine-Tuning) آشنا می‌شوید، جایی که یاد می‌گیرید چگونه داده خود را به‌درستی آماده کنید و مجموعه‌ داده سفارشی با استفاده از tokenizers و data collators را در عمل بسازید. در طول فرآیند SFT، تکنیک‌های کلیدی برای کاهش حجم و افزایش کارایی مدل‌های بزرگ، با استفاده از LoRA (Low-Rank Adaptation) و کوانتیزاسیون را بررسی می‌کنید و گام به گام چگونگی ادغام این فناوری‌ها در پروژه‌های خود را فرا می‌گیرید.

پس از تثبیت مبانی SFT، به سراغ DPO (Direct Preference Optimization) می‌روید. این روش به شما امکان می‌دهد نتایج متمرکز بر کاربر را به‌صورت مستقیم از بازخوردهای کاربر در مدل دریافت کنید. چگونگی فرمت‌بندی داده برای این متد، طراحی مکانیزم پاداش، و چگونگی اشتراک‌گذاری مدل‌های آموزش‌دیده در پلتفرم‌های محبوب مانند Hugging Face را یاد می‌گیرید. به‌علاوه، درک عمیق‌تری از چگونگی کار Data Collator در فرآیندهای DPO، تکنیک‌های عملی برای آماده‌سازی و تبدیل داده در سناریوهای مختلف به دست می‌آورید.

مرحله مهم دوره، GRPO (Group Relative Policy Optimization) است که روز به روز طرفداران بیشتری پیدا می‌کند. با GRPO، روش‌هایی برای بهینه‌سازی رفتار مدل نه تنها در سطح فردی، بلکه در میان جوامع و گروه‌های مختلف کاربران یاد می‌گیرید. این روش را سیستماتیک‌تر و مؤثرتر در خدمت‌رسانی به گروه‌های کاربران با نیازهای مختلف می‌کند. در این دوره، اصول اساسی GRPO را بررسی و به‌طور عملی با داده واقعی تجربه خواهید کرد.

در طول دوره، موضوعات کلیدی مانند LoRA، کوانتیزاسیون، SFT ،DPO و به‌خصوص GRPO را همراه با تمرین‌های پروژه‌محور پوشش می‌دهیم.

در پایان این دوره، شما به‌طور کامل قادر خواهید بود تمام مراحل را؛ از آماده‌سازی داده‌ به‌صورت end‑to‑end گرفته تا فاین‌تیونینگ مدل‌ها و بهینه‌سازی سیاست مبتنی بر گروه با اطمینان مدیریت کنید. همچنین توسعه‌ی راهکارهای مدرن و رقابتی مبتنی بر مدل‌های زبانی بزرگ (LLM) که هم بر عملکرد بالا و هم بر رضایت کاربر تمرکز دارند، در پروژه‌های شخصی شما بسیار ساده‌تر خواهد شد.

این دوره برای چه کسانی مناسب است؟

  • دانشمندان داده و مهندسان یادگیری ماشین که می‌خواهند در تکنیک‌های آموزش مدل‌های زبانی بزرگ (LLM) تخصص پیدا کنند.
  • افرادی که می‌خواهند به نکات کلیدی و بهترین شیوه ها برای آماده‌سازی داده‌ به‌طور کامل مسلط شوند.
  • توسعه‌دهندگان هوش مصنوعی که قصد دارند مدل‌های زبانی سفارشی خود را بسازند.
  • افرادی که می‌خواهند تجربه عملی با تکنیک‌های پیشرفته‌ای مانند Supervised Fine‑Tuning (SFT) و Direct Preference Optimization (DPO) و Group Relative Policy Optimization (GRPO) به دست آورند.
  • افرادی که می‌خواهند تجربه عملی و کاربردی با تکنیک Group Relative Policy Optimization (GRPO) داشته باشند.
  • افرادی که می‌خواهند نکات ضروری آماده‌سازی داده‌ را یاد بگیرند و مجموعه‌داده‌ه سفارشی خود را برای مدل‌های زبانی تطبیق دهند.
  • کسانی که به متدهای یادگیری تقویتی و بهینه‌سازی مدل‌ها بر اساس بازخورد کاربران علاقه‌مند هستند.

فاین‌تیونینگ مدل‌های زبانی بزرگ با یادگیری تقویتی به متد GRPO در DeepSeek

  • مقدمه 01:15
  • معرفی محتوای دوره 07:18
  • کوانتیزاسیون چیست؟ چگونه بر اندازه و پارامترهای مدل تأثیر می‌گذارد؟ 04:08
  • ساخت حساب کاربری در Hugging Face و دریافت توکن 03:45
  • ساخت نوت‌بوک در Colab و آشنایی با کتابخانه‌ها 03:24
  • دانلود مدل با کوانتیزاسیون 04:56
  • تفاوت‌های بین مدل‌های Base و Instruct 06:46
  • دانلود و بررسی مجموعه داده 03:44
  • آماده‌سازی مجموعه داده، قالب چت و ادغام توکن‌های سفارشی 11:41
  • ادامه تهیه و توکن‌سازی مجموعه داده 04:45
  • Data Collator چیست؟ چگونه کار می‌کند؟ مثال عملی 07:45
  • LoRA چیست؟ چرا استفاده می‌شود؟ 02:46
  • ادغام ماتریس‌های LoRA در مدل 06:21
  • تعیین پارامترهای آموزش (هایپرپارامترهای آموزش) 08:10
  • تنظیم Trainer، شروع آموزش و ارزیابی نتایج 03:02
  • ادغام ماتریس‌های آموزش‌دیده LoRA با مدل 05:19
  • بارگذاری مدل در Hugging Face و استفاده از آن 04:53
  • هایپرپارامترهای مؤثر بر خروجی‌ها 05:37
  • دانلود مدل و tokenizer 03:27
  • افزودن توکن‌های سفارشی جدید به tokenizer 06:43
  • ایجاد قالب‌ها با توکن‌های سفارشی جدید و ادغام آن‌ها در مجموعه داده 06:11
  • DPO چیست؟ چه فرمت داده‌ای انتظار دارد؟ 05:34
  • دانلود مدل و درک چگونگی عملکرد Data Collator در پدینگ داده‌ 05:11
  • آماده‌سازی مجموعه داده برای DPO 08:47
  • اضافه کردن ماتریس‌های LoRA به مدل 03:08
  • تنظیم پارامترهای آموزش (با DPOConfig) 04:12
  • آموزش مدل و ادغام ماتریس‌های LoRA 05:08
  • مدل «استدلالی» چیست و چگونه کار می‌کند؟ 03:49
  • GRPO چیست و چگونه اجرا می‌شود؟ 03:32
  • یعنی چه Unsloth و VLLM؟ + لینک دانلود مدل 05:20
  • بررسی مجموعه داده و مراحل اولیه آماده‌سازی 06:01
  • استخراج بخش‌های خاص از داده‌: regex و عملیات گروهی 10:28
  • داده‌ در چه قالبی به توابع پاداش ارسال می‌شوند؟ 05:36
  • نخستین تابع پاداش 10:44
  • دومین تابع پاداش 05:20
  • سومین تابع پاداش 08:25
  • چهارمین تابع پاداش 05:35
  • هایپرپارامترهای آموزش (همراه با تنظیمات GRPO) 06:06
  • آبجکت Trainer و فرآیند آموزش 01:55
  • جدول نتایج، پاداش‌ها و نمونه خروجی‌ها 03:13

2,185,200 546,300 تومان

مشخصات آموزش

فاین‌تیونینگ مدل‌های زبانی بزرگ با یادگیری تقویتی به متد GRPO در DeepSeek

  • تاریخ به روز رسانی: 1405/04/02
  • سطح دوره:همه سطوح
  • تعداد درس:40
  • مدت زمان :03:40:01
  • حجم :1.86GB
  • زبان:دوبله زبان فارسی
  • دوره آموزشی:AI Academy

آموزش های مرتبط

The Great Courses
6,100,500 1,220,100 تومان
  • زمان: 08:11:21
  • تعداد درس: 28
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
5,679,500 1,135,900 تومان
  • زمان: 07:37:25
  • تعداد درس: 47
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
1,272,500 254,500 تومان
  • زمان: 01:42:31
  • تعداد درس: 11
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
2,260,000 452,000 تومان
  • زمان: 03:02:02
  • تعداد درس: 14
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
795,000 159,000 تومان
  • زمان: 58:00
  • تعداد درس: 12
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
19,403,000 3,880,600 تومان
  • زمان: 26:02:40
  • تعداد درس: 175
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
8,508,000 1,701,600 تومان
  • زمان: 11:25:13
  • تعداد درس: 94
  • سطح دوره:
  • زبان: دوبله فارسی
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
1,833,000 366,600 تومان
  • زمان: 02:27:39
  • تعداد درس: 24
  • سطح دوره:
  • زبان: دوبله فارسی

آیا سوالی دارید؟

ما به شما کمک خواهیم کرد تا شغل و رشد خود را افزایش دهید.
امروز با ما تماس بگیرید