ارزیابی و مشاهدهپذیری عاملهای هوش مصنوعی LLM با Galileo AI
✅ سرفصل و جزئیات آموزش
آنچه یاد خواهید گرفت:
- طراحی یک برنامهی مشاهدهپذیری برای LLM: چه چیزهایی را لاگ کنید، تریسها را چگونه ساختاربندی کنید، و چگونه خطاها را قابلتشخیص کنید.
- ساخت مجموعهداده ارزیابی با ورودیهای واقعگرایانه، رفتار مورد انتظار، فراداده و بخشبندی برای موارد لبه و رگرسیونها
- اجرای آزمایشهای تکرارپذیر Galileo AI برای مقایسهی مدلها، پرامپتها و نسخههای عامل روی مجموعهداده تست یکسان
- پیادهسازی معیارهای ارزیابی سفارشی برای کیفیت تولید متن، Groundedness، ایمنی و درستی ابزارها (فراتر از دقت)
- اعمال امتیازدهی مدل زبانی بزرگ بهعنوان داور با Rubrics، محدودیتها و بررسیهای نمونهای برای کاهش سوگیری و drift ارزیاب
- اشکال زدایی خطاهای عامل با استفاده از تریسها برای شناسایی دقیق شکستها در بازیابی، برنامهریزی، استفاده از ابزار یا ترکیب پاسخ
- راهاندازی نظارت تولید در Galileo با سیگنالها، داشبوردها و هشدارها برای رگرسیونها و خطاهای خاموش
- استفاده از نتایج ارزیابی برای اولویتبندی اصلاحات، اعتبارسنجی بهبودها و جلوگیری از رگرسیونهای کیفیت یا ایمنی در طول زمان
- انتخاب متدهای مشاهدهپذیری و ارزیابی برای اپلیکیشنهای LLM تکدرخواست در برابر عاملهای چندمرحلهای، و توضیح ویژگی های خوب و بد
- ابزارگذاری اپلیکیشنها و عاملهای LLM در Galileo برای ثبت تریسها، spanها، پرامپتها، فراخوانی ابزارها و فراداده برای اشکال زدایی
- طراحی یک برنامهی مشاهدهپذیری برای LLM: چه چیزهایی را لاگ کنید، تریسها را چگونه ساختاربندی کنید، و چگونه خطاها را قابلتشخیص کنید؟
پیشنیازهای دوره
- دانش اولیه Python
- دانش اولیه ساخت AI Agent
- توانایی کار با Jupyter Notebook
- نیازی به تجربهی قبلی در مشاهدهپذیری نیست.
توضیحات دوره
ین دوره کاملاً عملی و کاربردی است و برای توسعهدهندگان، مهندسان هوش مصنوعی، بنیانگذاران و تیمهایی طراحی شده که در حال ساخت سیستمهای واقعی LLM و عاملهای هوش مصنوعی هستند. این دوره همچنین برای هر کسی که به مشاهدهپذیری LLM و ارزیابیهای هوش مصنوعی علاقهمند است و میخواهد این مهارتها را در اپلیکیشنهای عاملی آینده به کار بگیرد، ایدهآل است. شما باید تا حدی با عامل های هوش مصنوعی و نحوهی ساخت آنها آشنا باشید.
توجه داشته باشید که این راهنمای کامل مشاهدهپذیری و ارزیابی برای هوش مصنوعی است. ما هم به نظریه و هم به عمل میپردازیم و از Galileo AI بهعنوان پلتفرم نظارت AI Agent / LLM استفاده میکنیم. یادگیرندگان همچنین به همهی منابع و کدها / نوتبوکهای GitHub استفادهشده در دوره دسترسی خواهند داشت.
چرا مشاهدهپذیری LLM و ارزیابی مهم هستند؟
LLMها قدرتمند هستند، اما غیرقابلپیشبینیاند. آنها دچار توهم میشوند، بیصدا شکست میخورند و در پرامپتها و نسخههای مختلف رفتار متفاوتی دارند. تفاوت بزرگی بین ساخت یک سیستم عاملی / LLM و «عملیاتیسازی» کردن واقعی آن وجود دارد. اگر LLM شروع به تولید محتوای توهینآمیز کند چه؟ اگر ابزارهای تعبیهشده در عاملها بیصدا از کار بیفتند چه؟ کیفیت مدل را چگونه اندازهگیری میکنید وقتی افت میکند؟
متدهای سنتی نظارت و ساختوساز کار نمیکنند. شما باید آزمایش اجرا کنید، ارزیابیهای سفارشی بسازید و هشدارهایی تنظیم کنید که معیارهای ذهنی را هم بررسی کنند. داشبوردهایی که برای ردیابی دقت طبقهبندی ساخته شدهاند، برای تولید متن آزاد طراحی نشدهاند. پایپلاینهای لاگ که برای APIهای قابلپیشبینی ساخته شدهاند، نمیتوانند گامهای استدلال، استفاده از ابزار یا دلیل شکست یک عامل را ثبت کنند.
در نتیجه، بیشتر تیمها به بررسیهای دستی نمونهای، حس درونی و دستکاری بیپایان پرامپتها تکیه میکنند. این رویکرد شاید در ابتدا جواب بدهد، اما مقیاسپذیر نیست.
آنچه بهجای آن نیاز داریم، یک روش نظاممند برای اندازهگیری، نظارت، ارزیابی و بهبود مستمر سیستمهای LLM و عاملها است. اینجاست که مشاهده پذیری و ارزیابی ساختاریافته وارد میشوند.
این دوره چیست؟
این دوره هنگام ساخت و استقرار عامل های هوش مصنوعی یا سایر سیستمهای مبتنی بر LLM، اعتمادبهنفس بیشتری به شما میدهد. این دوره ابزارها و ترفندهای لازم برای ساخت عاملهای هوش مصنوعی robust با ارزیابیها و آزمایشهای ساختاریافته و شخصیسازیشده را آموزش میدهد و همچنین نشان میدهد چگونه عاملهای خود را در عملیاتی با مشاهده پذیری و لاگ کردن نظارت کنید. ابتدا با مبانی و نظریهای شروع میکنیم که توضیح میدهد چرا ساخت و ردیابی عامل های هوش مصنوعی / سیستمهای LLM بهطور خاص دشوار است. سپس وارد بخش عملی میشویم و ارزیابیهای خودمان را میسازیم و اپلیکیشنهای خود را با Galileo AI ابزارگذاری میکنیم.
Galileo AI چیست؟
Galileo یک پلتفرم است که بهطور ویژه برای ارزیابی و نظارت سیستمهای LLM و عاملها طراحی شده است. این پلتفرم مشخصاً برای عامل های هوش مصنوعی / سیستمهای مبتنی بر LLM ساخته شده و شامل قابلیتهای زیر است:
- مشاهدهپذیری: لاگ تعاملات LLM، ردیابی spanها و فراداده، مصورسازی جریان عامل، نظارت سیگنالهای ایمنی و انطباق
- ارزیابی: طراحی آزمایشها، ساخت مجموعهداده ارزیابی، تعریف و ثبت معیارها، استفاده از LLMها بهعنوان داور، نسخهبندی و مقایسهی نتایج
بهطور خلاصه، این پلتفرم روشی ساختاریافته برای درک رفتار سیستمهای هوش مصنوعی شما فراهم میکند و به شما کمک میکند آنها را بسازید. در این دوره، یک مسترکلاس کامل دربارهی Galileo AI و چگونگی استفاده از آن برای نظارت و ارزیابی اپلیکیشن هوش مصنوعی خود خواهید داشت.
بررسی دوره:
- مقدمه - ابتدا توضیح میدهیم چرا ارزیابی و مشاهدهپذیری برای LLMها مهم هستند، ریسکهای استقرار generative AI بدون نظارت ساختاریافته را بررسی میکنیم، انتظارات را مشخص میکنیم و نقشهی راه دوره را مرور میکنیم.
- نظریه: مشاهدهپذیری LLM/Agent - این بخش مفاهیم سنتی نظارت را معرفی میکند، توضیح میدهد چرا برای سیستمهای مولد کافی نیستند، و اجزای کلیدی مشاهدهپذیری در LLM را تشریح میکند.
- نظریه: ارزیابیهای LLM / Agent - شما نظریهی ارزیابی را بررسی میکنید، میفهمید چرا ارزیابیها برای AI در عملیاتی حیاتی هستند، با رویکردهای اصلی ارزیابی آشنا میشوید و چالشهای رایج تیمها با LLMها را میبینید.
- نظریه: مشاهدهپذیری و ارزیابی برای LLMها در مقایسه با ML سنتی - generative AI را با یادگیری ماشین کلاسیک مقایسه میکنیم و ریسکها، هزینهها و چرخههای تکرار منحصربهفرد آن را برجسته میکنیم.
- نظریه: ابزارها و رویکردها برای مشاهدهپذیری LLM و ارزیابی - این بخش چشمانداز ابزارهای موجود برای مشاهدهپذیری و ارزیابی سیستمهای LLM را مرور میکند و توضیح میدهد چرا پلتفرمهای اختصاصی ضروری هستند.
- عملی: بررسی عمیق پلتفرم Galileo و راهاندازی - این بخش شما را با معماری Galileo، یکپارچهسازیها، قیمتگذاری، ایجاد حساب، کلونکردن مخزن و راهاندازی توسعهی محلی آشنا میکند تا برای ابزارگذاری آماده شوید.
- عملی: لاگ کردن تعاملات LLM با Galileo - با لاگ کردن عملی در Galileo آشنا میشوید، از جمله اصطلاحات، روشهای دستی و مبتنی بر SDK، شبیهسازی اپلیکیشنهای LLM، بررسی گراف عامل، شناسایی خطاها و راهاندازی alertها و signalها.
- عملی: ارزیابی عملکرد LLM با Galileo - از مشاهده به ارزیابی میرویم و نشان میدهیم چگونه آزمایش طراحی کنید، مجموعهداده و فراداده را مدیریت کنید، کد ارزیابی را پیادهسازی کنید، معیارها را تعریف کنید و ارزیابیهای مخصوص عامل و مدل زبانی بزرگ بهعنوان داور را انجام دهید.
این دوره برای چه کسانی مناسب است؟
- مهندسان هوش مصنوعی و مهندسان ML
- مهندسان نرمافزار که اپلیکیشنهای عاملی میسازند.
- مهندسان پلتفرم یا زیرساخت
- برای مهندسان هوش مصنوعی و هر کسی که اپلیکیشنهای LLM یا عاملی میسازد
- توسعهدهندگانی که Gen AI را در محیط عملیاتی مستقر میکنند.
- تیمهایی که در ارزیابی و اشکال زدایی سیستمهای LLM مشکل دارند.
- بنیانگذارانی که اپلیکیشنهای مبتنی بر هوش مصنوعی میسازند.
- اگر شما مسئول کیفیت هوش مصنوعی هستید و به دنبال راهی برای اندازهگیری آن میگردید.
- هر کسی که میخواهد کنترل ساختاریافته و نظاممند بر رفتار هوش مصنوعی داشته باشد.
- هر کسی که میخواهد بداند چرا هوش مصنوعی شکست میخورد و چگونه آن را برطرف کند.
- مهندسانی که روی ایمنی و انطباق کار میکنند.
- مدیران فنی محصول برای محصولات هوش مصنوعی
ارزیابی و مشاهدهپذیری عاملهای هوش مصنوعی LLM با Galileo AI
-
چرا ارزیابی و مشاهدهپذیری برای LLM مهم هستند؟ 09:11
-
این دوره چیست؟ 03:28
-
نقشهی راه دوره 03:12
-
دربارهی مدرس 02:13
-
کلیدهای موفقیت 02:17
-
راههای ارتباط 00:53
-
امتیاز دهید 00:56
-
تماشا با کیفیت 1080p 00:50
-
از نظارت سنتی تا مشاهدهپذیری 09:34
-
چرا سیستمهای هوش مصنوعی به مشاهدهپذیری نیاز دارند؟ 09:44
-
اجزای اصلی مشاهدهپذیری در LLM 08:38
-
چرا ارزیابیها حیاتی هستند؟ 10:39
-
انواع و رویکردهای ارزیابی LLM 08:58
-
چالشهای ارزیابی LLM 06:13
-
چالشهای منحصربهفرد مشاهدهپذیری در LLM در مقایسه با ML سنتی 07:02
-
عوامل منحصربهفرد ریسک و هزینه در مشاهدهپذیری و ارزیابی LLM 05:05
-
چرخههای تکرار و چرخهی عمر در توسعهی LLM 05:25
-
چرا به یک پلتفرم اختصاصی نیاز است؟ 05:16
-
چشمانداز پلتفرمهای ارزیابی و ارزیابی 09:32
-
Galileo چیست؟ 11:08
-
یکپارچهسازیها 01:12
-
مشکلات و راهحلها با Galileo 06:45
-
قیمتگذاری 02:19
-
ایجاد حساب Galileo 03:15
-
کلون کردن مخزن 04:49
-
مخزن و راهاندازی محلی 07:18
-
مقدمهای بر مشاهدهپذیری 02:22
-
اصطلاحات لاگ کردن 09:02
-
چرا لاگ بگیریم و متدهای مختلف لاگ کردن چیست؟ 04:53
-
مبانی logging دستی 11:57
-
انواع span و فراداده 12:20
-
دکوراتور لاگ 11:55
-
Galileo OpenAI SDK 19:42
-
شبیهسازی یک اپلیکیشن LLM 04:14
-
مشاهدهی نتایج فراخوانی LLM در داشبورد Galileo 09:39
-
فراخوانیهای واقعی عامل و جمعآوری لاگها 05:09
-
گراف عامل 07:01
-
گراف عامل؛ یافتن سرنخها دربارهی ابزارهای معیوب و فراخوانیهای LLM 04:54
-
لاگ کردن، هشدارها، سیگنالها و نمونهبرداری معیارها 07:51
-
از مشاهده به ارزیابی 02:59
-
تشبیه به ارزیابی هوش مصنوعی 05:27
-
آزمایشها و معیارها 06:29
-
ایجاد مجموعهداده 14:25
-
فراداده 06:05
-
نسخهبندی 05:35
-
محیط آزمایش 18:49
-
کد آزمایشها 16:19
-
پاسخ جعبهی معیارها 06:44
-
معیارهای ایمنی و انطباق 09:54
-
بیان و اطمینان 06:59
-
معیارهای عاملی 07:22
-
معیارهای عامل 2 15:51
-
معیارهای محلی 17:38
-
معیارهای ثبتشده 09:51
-
LLM بهعنوان داور 11:11
-
مهندسی پرامپت 09:02
-
LLM بهعنوان داور با استفاده از کد و سایر انواع خروجی 19:06
-
جمعبندی و دریافت گواهینامه 01:39
مشخصات آموزش
ارزیابی و مشاهدهپذیری عاملهای هوش مصنوعی LLM با Galileo AI
- تاریخ به روز رسانی: 1405/04/12
- سطح دوره:Alls
- تعداد درس:58
- مدت زمان :07:29:00
- حجم :11.22GB
- زبان:دوبله زبان فارسی
- دوره آموزشی:AI Academy