نشت داده
در آمار و یادگیری ماشین، نشت داده استفاده از اطلاعاتی در فرایند آموزش مدل است که انتظار نمیرود در زمان پیشبینی در دسترس باشد، و باعث میشود نمرات پیشبینی کننده (معیارها) بیش از حد ابزار مدل هنگام اجرا در یک محیط تولید را ارزیابی کند.[۱]
نشت اغلب ظریف و غیرمستقیم است و تشخیص و از بین بردن آن دشوار است. نشت میتواند باعث شود یک آمارگر یا مدلساز مدلی کمتر از حد بهینه را انتخاب کند، که میتواند از یک مدل بدون نشت بهتر عمل کند[۱]
حالتهای نشتی
نشت میتواند در بسیاری از مراحل در فرایند یادگیری ماشین رخ دهد. علل نشت میتواند به دو منبع ممکن نشت برای یک مدل طبقهبندی شود: ویژگیها و نمونههای آموزش.[۱]
نشتی ویژگی
ویژگی یا ستون نشت عاقلانه ناشی از درج ستونهایی است که یکی از موارد زیر است: یک برچسب تکراری، یک پروکسی برای برچسب یا خود برچسب. این ویژگیها که به نام آناکرونیسم شناخته میشوند، زمانی که مدل برای پیشبینی استفاده میشود، در دسترس نخواهند بود، و در صورتی که مدل آموزش داده شود، نشت نتیجه میدهد
نشت نمونه آموزشی
نشت عاقلانه ردیف ناشی از به اشتراک گذاری نادرست اطلاعات بین ردیف دادهها است.
برای مجموعه دادههای وابسته به زمان، ساختار سیستم مورد مطالعه با گذشت زمان تکامل مییابد (یعنی 'غیر ثابت' است). این میتواند تفاوتهای سیستماتیک بین مجموعههای آموزش و اعتبار سنجی را ایجاد کند.
به عنوان مثال، اگر مدلی برای پیشبینی مقادیر سهام برای یک دوره پنج ساله خاص در دادهها آموزش داده شود، درمان دوره ۵ ساله بعدی به عنوان یک قرعه کشی از همان جمعیت غیر واقعی است.
به عنوان نمونه دیگر، فرض کنید یک مدل برای پیشبینی خطر فرد برای تشخیص بیماری خاص در سال آینده تهیه شده است.
- 1 2 3 Shachar Kaufman; Saharon Rosset; Claudia Perlich (January 2011). "Leakage in Data Mining: Formulation, Detection, and Avoidance". Proceedings of the ACM SIGKDD International Conference on Knowledge Discovery and Data Mining. 6: 556–563. doi:10.1145/2020408.2020496. Retrieved 13 January 2020. خطای یادکرد: برچسب
<ref>نامعتبر؛ نام «KaufmanKDD11» چندین بار با محتوای متفاوت تعریف شده است. (صفحهٔ راهنما را مطالعه کنید.).