نظارت بر LLM تولید شما در واقع چه چیزی را در مقابل چه چیزی از دست می دهد؟


برای مهندسان و تیم‌هایی که محصولات LLM را ارسال می‌کنند: کنجکاو باشید که تنظیم نظارت در دنیای واقعی شما در مقابل آنچه که واقعاً جلب می‌کند چگونه به نظر می‌رسد.

پشته مشترکی که من می بینم: ردیابی تاخیر، نظارت بر هزینه رمز، نرخ خطای اساسی، شاید امتیازدهی LLM-as-a-judge. چیزی که کمتر در موردش می شنوم: چیزی که می گذرد.

چند الگو که من مدام با آنها برخورد می کنم:

– خروجی هایی که در ارزیابی ها امتیاز خوبی کسب می کنند، اما در وظایف پایین دستی ظریف شکست می خورند

– شکست‌هایی که فقط پس از توقف تعامل کاربران ظاهر می‌شوند (شکست‌های بی‌صدا در مقابل موارد پرچم‌دار)

– مدل‌هایی که در یک معیار بهبود می‌یابند اما بی‌صدا در معیار دیگر پسرفت می‌کنند

چه چیزی شما را در مورد آنچه نظارت شما از دست داده است شگفت زده کرده است؟ و آیا کسی واقعاً حلقه را بسته است، جایی که داده های شکست تولید مستقیماً یک مدل یا تصمیم مسیریابی را بهبود می بخشد؟

ارسال شده توسط /u/Historical-Willow679
(لینک) (نظرات)


Source link

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *