ارزیابی برای اپلیکیشنهای LLM
✅ سرفصل و جزئیات آموزش
آنچه یاد خواهید گرفت:
- درک متدهای اصلی ارزیابی مدلهای زبانی بزرگ، شامل رویکردهای انسانی، خودکار و ترکیبی.
- اعمال چارچوبهای تحلیل خطای سیستماتیک برای شناسایی، دستهبندی و رفع خطاهای مدل
- طراحی و نظارت بر سیستمهای تولید تقویتشده با بازیابی (RAG) با معیارهای ارزیابی قابل اعتماد
- پیادهسازی پایپ لاین های ارزیابی آماده تولید با نظارت مستمر، حلقههای بازخورد و استراتژیهای بهینهسازی هزینه
پیشنیازهای دوره
- هیچ پیشنیاز سختگیرانهای وجود ندارد - دانش اولیه از هوش مصنوعی یا توسعه نرمافزار مفید است اما الزامی نیست.
توضیحات دوره
مدلهای زبانی بزرگ (LLMs) روش ساخت اپلیکیشن ها را - از چتباتها و ابزارهای پشتیبانی مشتری تا دستیاران دانش پیشرفته تغییر دادهاند. اما استقرار این سیستمها در دنیای واقعی با چالش مهمی همراه است: چگونه آنها را بهطور مؤثر ارزیابی کنیم؟
این دوره، ارزیابی برای اپلیکیشن های مدلهای زبانی بزرگ، به شما یک چارچوب کامل برای طراحی، نظارت و بهبود سیستمهای مبتنی بر مدلهای زبانی بزرگ با اطمینان ارائه میدهد. شما هم اصول نظری و هم تکنیکهای عملی لازم برای اطمینان از دقت، ایمنی، کارایی و مقرونبهصرفه بودن مدلهای خود را یاد خواهید گرفت.
ما با اصول ارزیابی مدلهای زبانی بزرگ شروع میکنیم، متدهای ذاتی در مقابل بیرونی را بررسی میکنیم و اینکه چه چیزی یک مدل را «خوب» میسازد. سپس به تحلیل خطای سیستماتیک میپردازیم، یاد میگیرید چگونه ورودیها، خروجیها و فراداده را ثبت کنید و پایپ لاین های مشاهدهپذیری را اعمال کنید. از آنجا به تکنیکهای ارزیابی، شامل بررسی انسانی، معیارهای خودکار، رویکردهای LLM-as-a-judge و امتیازدهی زوجی میرویم.
تمرکز ویژهای بر سیستمهای تولید تقویتشده با بازیابی (RAG) شده است، جایی که یاد میگیرید چگونه کیفیت بازیابی، وفاداری و عملکرد کلی را اندازهگیری کنید. در نهایت، یاد میگیرید چگونه نظارت آماده تولید را طراحی کنید، حلقههای بازخورد بسازید و هزینهها را از طریق استراتژیهای هوشمندانه توکن و مدل بهینه کنید.
چه یک مهندس DevOps، توسعهدهنده نرمافزار، دانشمند داده یا تحلیلگر داده باشید، این دوره شما را با دانش عملی برای ارزیابی اپلیکیشن های مدلهای زبانی بزرگ در محیطهای واقعی مجهز میکند. در پایان، شما آماده خواهید بود تا پایپ لاین های ارزیابی را طراحی کنید که کیفیت را بهبود میدهد، ریسکها را کاهش میدهد و ارزش را به حداکثر میرساند.
این دوره برای چه کسانی مناسب است؟
- مهندسان DevOps که میخواهند ارزیابی مدلهای زبانی بزرگ را در پایپ لاین های تولید ادغام کنند.
- توسعهدهندگان نرمافزار که علاقهمند به ساخت اپلیکیشن های قابل اعتماد مجهز به هوش مصنوعی هستند.
- دانشمندان داده که به دنبال تحلیل و نظارت بر عملکرد مدل هستند.
- تحلیلگران داده که میخواهند معیارهای ارزیابی و الگوهای خطا را درک کنند.
- متخصصان هوش مصنوعی که به دنبال چارچوبهای عملی برای تست و بهبود مدلهای زبانی بزرگ هستند.
- متخصصان فناوری که میخواهند کیفیت، ایمنی و هزینه مدل را در سیستمهای واقعی متعادل کنند.
ارزیابی برای اپلیکیشنهای LLM
-
مقدمه 03:57
-
انواع ارزیابیها – ذاتی در مقابل بیرونی 02:23
-
چه چیزی یک مدل زبانی بزرگ را «خوب» میکند؟ (دقت، مفید بودن، ایمنی، تأخیر) 02:30
-
چالشهای ارزیابی خروجیهای تولیدی 02:34
-
کوییز – بخش 1: مبانی ارزیابی مدلهای زبانی بزرگ None
-
ثبت ورودیها، خروجیها و فراداده مدلهای زبانی بزرگ 02:36
-
راهاندازی پایپ لاین های مشاهدهپذیری (OpenTelemetry ،Prometheus و غیره) 02:23
-
معیارهای پیگیری (تأخیر، استفاده از توکن، رضایت کاربر) 02:33
-
کوییز – بخش 2: ابزارسازی و مشاهدهپذیری None
-
دستهبندی خطاهای مدلهای زبانی بزرگ (توهمات، سوگیری، سمیت) 02:23
-
چارچوبهای تحلیل ریشهای 02:28
-
حلقههای بازخورد و استراتژیهای ثبت خطا 02:28
-
آزمون – بخش 3: تحلیل نظاممند خطا None
-
ارزیابی انسانی در مقابل ارزیابی خودکار 02:17
-
استفاده از مدلهای زبانی بزرگ برای ارزیابی مدلهای دیگر (تکنیکهای LLM-as-a-judge) 02:35
-
روشهای مقایسه زوجی و امتیازدهی 02:21
-
کوییز – بخش 4: تکنیکهای ارزیابی و رویکردهای LLM-as-a-judge None
-
چه چیزی تولید تقویتشده با بازیابی را متفاوت میکند؟ 02:16
-
ارزیابی کیفیت بازیابی (بازیابی، دقت، مرتبط بودن) 02:22
-
ارزیابی ترکیبی بازیابی و تولید 02:21
-
کوییز – بخش 5: ارزیابی سیستمهای RAG None
-
طراحی ارزیابی در محیطهای تولید 02:05
-
ادغام ارزیابی در پایپ لاین های CI/CD یا گردش کار 02:21
-
هشدارها، آستانهها و پاسخ به حوادث 02:27
-
کوییز – بخش 6: نظارت بر تولید و ارزیابی مستمر None
-
ایجاد سیستمهای بررسی مقیاسپذیر با حضور انسان در حلقه 02:14
-
تعادل بین کیفیت ارزیابی و محدودیتهای بودجه 02:07
-
استراتژیهای انتخاب توکن و مدل برای کاهش هزینهها 02:17
-
کوییز – بخش 7: بررسی انسانی و بهینهسازی هزینه None
-
نتیجهگیری دوره – نکات کلیدی 05:41
مشخصات آموزش
ارزیابی برای اپلیکیشنهای LLM
- تاریخ به روز رسانی: 1405/04/02
- سطح دوره:متوسط
- تعداد درس:30
- مدت زمان :59:39
- حجم :419.0MB
- زبان:دوبله زبان فارسی
- دوره آموزشی:AI Academy