دورهی ارزیابی و پایش مدلهای زبانی
LLM Evaluation & Observability
بهجای حدسزدن دربارهی کارکرد اپلیکیشن مبتنی بر مدل زبانی، یک روند واقعی ارزیابی و پایش بسازید: مجموعهدادهی ارزیابی، معیارها، داوری با مدل زبانی، ارزیابی RAG و ایجنتها، ردگیری و پایش در محیط عملیاتی، با تمرین عملی در پایتون. این دوره برای تیمهای سازمانی، بهصورت حضوری یا آنلاین و به زبان فارسی برگزار میشود.
- سطح
- متوسط
- مدت دوره
- ۳ روز (۲۴ ساعت)
- درس در ۹ بخش
- ۴۱
- شیوهی برگزاری
- حضوری یا آنلاین
آنچه شرکتکنندگان میآموزند
- توضیح اینکه چرا «ظاهراً درست کار میکند» دلیلی بر کارکرد درست یک قابلیت هوش مصنوعی نیست
- ساخت مجموعهدادهی مرجع که بازتاب استفادهی واقعی باشد
- انتخاب میان معیارهای قطعی، مبتنی بر پاسخ مرجع و داوری با مدل زبانی
- ارزیابی تخصصی جریانهای RAG و ایجنتهای ابزارمحور
- ردگیری، پایش و محافظت از اپلیکیشن مبتنی بر مدل زبانی در محیط عملیاتی
کار عملی: سامانهی ارزیابی و پایش برای یک اپلیکیشن مبتنی بر مدل زبانی
سرفصل دوره
۹ بخش و ۴۱ درس، در ۳ روز آموزشی (۲۴ ساعت، هر روز ۸ ساعت). سرفصل، مدت و تمرینها متناسب با سطح و نیاز تیم شما تنظیم میشود.
- ۱
چرا ارزیابی اهمیت دارد
۵ درس- دام «ظاهراً درست است»
- ارزیابی آفلاین در برابر آنلاین
- نگرش ارزیابیمحور
- چه چیزی را بسنجیم: ابعاد کیفیت
- پروژهی راهنمادار: اولین سامانهی ارزیابی
- ۲
ساخت مجموعهدادهی ارزیابی
۵ درس- مجموعهی مرجع: ویژگیهای یک مجموعهدادهی ارزیابی خوب
- نوشتن دستی موارد آزمون
- از گزارشهای عملیاتی تا مجموعهی آزمون
- پوشش، تفکیک و پاکیزگی مجموعهداده
- پروژهی راهنمادار: ساخت مجموعهی مرجع برای Docent
- ۳
معیارهای قطعی و مبتنی بر پاسخ مرجع
۵ درس- تطابق دقیق و یکسانسازی
- F1 در سطح توکن و معیارهای همپوشانی
- معیارهای ROUGE، BLEU و N-gram
- بررسی خروجی ساختاریافته و Schema
- پروژهی راهنمادار: کارنامهی معیارهای مرجع
- ۴
داوری با مدل زبانی (LLM-as-Judge)
۵ درس- چرا و چه زمانی از مدل زبانی بهعنوان داور استفاده کنیم
- امتیازدهی مستقیم با سنجهنامه
- مقایسهی دوبهدو و ترجیح
- واسنجی داور و اعتماد به آن
- پروژهی راهنمادار: داور واسنجیشده برای Docent
- ۵
ارزیابی RAG
۵ درس- مسئلهی ارزیابی RAG: دو سامانه در یک سامانه
- معیارهای بازیابی: Precision، Recall، MRR و NDCG
- وفاداری به منبع و مستندبودن پاسخ
- مرتبطبودن پاسخ و کیفیت زمینه
- پروژهی راهنمادار: ارزیابی کامل یک RAG
- ۶
ارزیابی ایجنتها و بهکارگیری ابزار
۵ درس- چرا ارزیابی ایجنتها دشوارتر است
- معیارهای موفقیت در انجام وظیفه و نتیجه
- درستی فراخوانی ابزار
- ارزیابی مسیر حرکت ایجنت
- پروژهی راهنمادار: ارزیابی نسخهی ایجنتیک Docent
- ۷
پایشپذیری و ردگیری
۵ درس- از ارزیابی تا پایشپذیری
- ثبت ساختاریافتهی فراخوانیهای مدل
- Trace و Span: دنبالکردن یک درخواست
- حسابرسی هزینه، تأخیر و توکن
- پروژهی راهنمادار: ابزارگذاری Docent برای پایش
- ۸
پایش در محیط عملیاتی و سازوکارهای محافظتی
۵ درس- پایش در محیط عملیاتی: داشبورد و هشدار
- تشخیص رانش و افت عملکرد
- آزمون پسرفت پرامپت و مدل در CI
- سازوکارهای محافظتی و بازخورد انسانی
- پروژهی راهنمادار: سامانهی پایش و محافظت
- ۹
پروژهی پایانی
۱ درس- پروژهی راهنمادار: سامانهی کامل ارزیابی و پایش
شیوههای برگزاری
حضوری در محل سازمان
برگزاری کلاس در سازمان شما، با تمرین روی ابزارها و نمونههایی نزدیک به کار روزانهی تیم. زمان و مکان با هماهنگی تعیین میشود.
آنلاین و زنده
کلاسهای تعاملی آنلاین با پرسش و پاسخ، تمرین گروهی و بازخورد مستقیم؛ مناسب تیمهایی که در چند شهر یا دورکار هستند.
کارگاه کوتاه یا دورهی جامع
از کارگاه یکروزه برای یک موضوع مشخص تا دورهی چندماهه برای آمادهکردن تیم در یک مسیر شغلی کامل.
دورههای مرتبط
همهی دورههابرگزاری دورهی ارزیابی و پایش مدلهای زبانی در سازمان شما
تعداد شرکتکنندگان، سطح تیم و زمان مدنظر را بفرستید تا برای نیازسنجی و هماهنگی برنامهی دوره با شما تماس گرفته شود.