برای مهندسان و تیمهایی که محصولات LLM را ارسال میکنند: کنجکاو باشید که تنظیم نظارت در دنیای واقعی شما در مقابل آنچه که واقعاً جلب میکند چگونه به نظر میرسد.
پشته مشترکی که من می بینم: ردیابی تاخیر، نظارت بر هزینه رمز، نرخ خطای اساسی، شاید امتیازدهی LLM-as-a-judge. چیزی که کمتر در موردش می شنوم: چیزی که می گذرد.
چند الگو که من مدام با آنها برخورد می کنم:
– خروجی هایی که در ارزیابی ها امتیاز خوبی کسب می کنند، اما در وظایف پایین دستی ظریف شکست می خورند
– شکستهایی که فقط پس از توقف تعامل کاربران ظاهر میشوند (شکستهای بیصدا در مقابل موارد پرچمدار)
– مدلهایی که در یک معیار بهبود مییابند اما بیصدا در معیار دیگر پسرفت میکنند
چه چیزی شما را در مورد آنچه نظارت شما از دست داده است شگفت زده کرده است؟ و آیا کسی واقعاً حلقه را بسته است، جایی که داده های شکست تولید مستقیماً یک مدل یا تصمیم مسیریابی را بهبود می بخشد؟
ارسال شده توسط /u/Historical-Willow679
(لینک) (نظرات)
Source link
rerasa