هوش مصنوعی مولد و مدل‌های زبانی

دوره‌ی ارزیابی و پایش مدل‌های زبانی

LLM Evaluation & Observability

به‌جای حدس‌زدن درباره‌ی کارکرد اپلیکیشن مبتنی بر مدل زبانی، یک روند واقعی ارزیابی و پایش بسازید: مجموعه‌داده‌ی ارزیابی، معیارها، داوری با مدل زبانی، ارزیابی RAG و ایجنت‌ها، ردگیری و پایش در محیط عملیاتی، با تمرین عملی در پایتون. این دوره برای تیم‌های سازمانی، به‌صورت حضوری یا آنلاین و به زبان فارسی برگزار می‌شود.

سطح
متوسط
مدت دوره
۳ روز (۲۴ ساعت)
درس در ۹ بخش
۴۱
شیوه‌ی برگزاری
حضوری یا آنلاین

آنچه شرکت‌کنندگان می‌آموزند

  • توضیح اینکه چرا «ظاهراً درست کار می‌کند» دلیلی بر کارکرد درست یک قابلیت هوش مصنوعی نیست
  • ساخت مجموعه‌داده‌ی مرجع که بازتاب استفاده‌ی واقعی باشد
  • انتخاب میان معیارهای قطعی، مبتنی بر پاسخ مرجع و داوری با مدل زبانی
  • ارزیابی تخصصی جریان‌های RAG و ایجنت‌های ابزارمحور
  • ردگیری، پایش و محافظت از اپلیکیشن مبتنی بر مدل زبانی در محیط عملیاتی

کار عملی: سامانه‌ی ارزیابی و پایش برای یک اپلیکیشن مبتنی بر مدل زبانی

سرفصل دوره

۹ بخش و ۴۱ درس، در ۳ روز آموزشی (۲۴ ساعت، هر روز ۸ ساعت). سرفصل، مدت و تمرین‌ها متناسب با سطح و نیاز تیم شما تنظیم می‌شود.

  1. ۱

    چرا ارزیابی اهمیت دارد

    ۵ درس
    • دام «ظاهراً درست است»
    • ارزیابی آفلاین در برابر آنلاین
    • نگرش ارزیابی‌محور
    • چه چیزی را بسنجیم: ابعاد کیفیت
    • پروژه‌ی راهنمادار: اولین سامانه‌ی ارزیابی
  2. ۲

    ساخت مجموعه‌داده‌ی ارزیابی

    ۵ درس
    • مجموعه‌ی مرجع: ویژگی‌های یک مجموعه‌داده‌ی ارزیابی خوب
    • نوشتن دستی موارد آزمون
    • از گزارش‌های عملیاتی تا مجموعه‌ی آزمون
    • پوشش، تفکیک و پاکیزگی مجموعه‌داده
    • پروژه‌ی راهنمادار: ساخت مجموعه‌ی مرجع برای Docent
  3. ۳

    معیارهای قطعی و مبتنی بر پاسخ مرجع

    ۵ درس
    • تطابق دقیق و یکسان‌سازی
    • F1 در سطح توکن و معیارهای هم‌پوشانی
    • معیارهای ROUGE، BLEU و N-gram
    • بررسی خروجی ساختاریافته و Schema
    • پروژه‌ی راهنمادار: کارنامه‌ی معیارهای مرجع
  4. ۴

    داوری با مدل زبانی (LLM-as-Judge)

    ۵ درس
    • چرا و چه زمانی از مدل زبانی به‌عنوان داور استفاده کنیم
    • امتیازدهی مستقیم با سنجه‌نامه
    • مقایسه‌ی دوبه‌دو و ترجیح
    • واسنجی داور و اعتماد به آن
    • پروژه‌ی راهنمادار: داور واسنجی‌شده برای Docent
  5. ۵

    ارزیابی RAG

    ۵ درس
    • مسئله‌ی ارزیابی RAG: دو سامانه در یک سامانه
    • معیارهای بازیابی: Precision، Recall، MRR و NDCG
    • وفاداری به منبع و مستندبودن پاسخ
    • مرتبط‌بودن پاسخ و کیفیت زمینه
    • پروژه‌ی راهنمادار: ارزیابی کامل یک RAG
  6. ۶

    ارزیابی ایجنت‌ها و به‌کارگیری ابزار

    ۵ درس
    • چرا ارزیابی ایجنت‌ها دشوارتر است
    • معیارهای موفقیت در انجام وظیفه و نتیجه
    • درستی فراخوانی ابزار
    • ارزیابی مسیر حرکت ایجنت
    • پروژه‌ی راهنمادار: ارزیابی نسخه‌ی ایجنتیک Docent
  7. ۷

    پایش‌پذیری و ردگیری

    ۵ درس
    • از ارزیابی تا پایش‌پذیری
    • ثبت ساختاریافته‌ی فراخوانی‌های مدل
    • Trace و Span: دنبال‌کردن یک درخواست
    • حسابرسی هزینه، تأخیر و توکن
    • پروژه‌ی راهنمادار: ابزارگذاری Docent برای پایش
  8. ۸

    پایش در محیط عملیاتی و سازوکارهای محافظتی

    ۵ درس
    • پایش در محیط عملیاتی: داشبورد و هشدار
    • تشخیص رانش و افت عملکرد
    • آزمون پسرفت پرامپت و مدل در CI
    • سازوکارهای محافظتی و بازخورد انسانی
    • پروژه‌ی راهنمادار: سامانه‌ی پایش و محافظت
  9. ۹

    پروژه‌ی پایانی

    ۱ درس
    • پروژه‌ی راهنمادار: سامانه‌ی کامل ارزیابی و پایش

شیوه‌های برگزاری

حضوری در محل سازمان

برگزاری کلاس در سازمان شما، با تمرین روی ابزارها و نمونه‌هایی نزدیک به کار روزانه‌ی تیم. زمان و مکان با هماهنگی تعیین می‌شود.

آنلاین و زنده

کلاس‌های تعاملی آنلاین با پرسش و پاسخ، تمرین گروهی و بازخورد مستقیم؛ مناسب تیم‌هایی که در چند شهر یا دورکار هستند.

کارگاه کوتاه یا دوره‌ی جامع

از کارگاه یک‌روزه برای یک موضوع مشخص تا دوره‌ی چندماهه برای آماده‌کردن تیم در یک مسیر شغلی کامل.

دوره‌های مرتبط

همه‌ی دوره‌ها

برگزاری دوره‌ی ارزیابی و پایش مدل‌های زبانی در سازمان شما

تعداد شرکت‌کنندگان، سطح تیم و زمان مدنظر را بفرستید تا برای نیازسنجی و هماهنگی برنامه‌ی دوره با شما تماس گرفته شود.