Перейти к содержимому

Обучающая, валидационная и тестовая выборки: зачем нужны все три

DataMListic

0:00 / 0:00

Обучающая, валидационная и тестовая выборки: зачем нужны все три

2 646 просмотров · 4 недели назад
DataMListic
74,4 тыс. подписчиков
2 646 просмотров · 4 недели назад
Модель, которая идеально показывает себя на обучающих данных, всё равно может сильно ошибиться на следующей точке, и известное всем решение — отложить часть данных — имеет свой собственный, едва заметный, сбойный режим. В тот момент, когда вы используете набор данных для принятия решения, выбирая модель, степень полинома, точку остановки, этот набор данных перестаёт измерять обобщающую способность. Выбор — это форма подгонки, и измеренный результат всегда частично истинен, частично удача: выбрав лучшего из множества кандидатов, вы выбираете на удачу. Всю эту историю мы строим на одной крошечной задаче регрессии: девять зашумлённых точек и степень полинома для выбора. Сначала мы наблюдаем, как интерполянт восьмой степени запоминает каждую обучающую точку и терпит неудачу на новой, а затем выявляем это с помощью отложенного набора данных. Затем следует ловушка: настройка степени на этом отложенном наборе данных незаметно её расходует, и при наличии двенадцати одинаково хороших кандидатов «победителем» оказывается просто самый удачный результат, проклятие победителя. Именно поэтому мы разделяем данные на три части: обучающие данные соответствуют параметрам, данные для валидации запоминают решения, а тестовый набор данных обрабатывается ровно один раз, после того, как все данные зафиксированы, что и делает его ответ достоверным. Похожие видео ▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬ Переобучение и недообучение — объяснение:    • Overfitting vs Underfitting - Explained   Кросс-валидация — объяснение:    • Cross-Validation Explained   Почему модели переобучаются и недообучаются — компромисс между смещением и дисперсией:    • Bias-Variance Trade-off - Explained   Двойной спуск — почему более крупные модели перестают переобучаться:    • Double Descent - Why Bigger Models Stop Ov...   Бутстрап-перевыборка — объяснение:    • Bootstrap Resampling - Explained   Гребневая регрессия — объяснение:    • Ridge Regression is a Gaussian Prior   Содержание ▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬ 00:00 - Идеальный результат 00:42 - Скрыть некоторые данные 01:30 - Ловушка настройки 02:30 - Проклятие победителя 03:21 - Три сета, три работы 04:12 - Один честный ответ Подписаться Я ▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬ 🐦 X: @datamlistic https://x.com/datamlistic 📸 Instagram: @datamlistic   / datamlistic   📱 TikTok: @datamlistic   / datamlistic   👔 Linkedin:   / datamlistic   Канал Поддержка ▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬ Лучший способ поддержать канал — поделиться контентом. ;) Если вы также хотите поддержать канал финансово, пожертвование в размере стоимости чашки кофе всегда приветствуется! (полностью необязательно и добровольно) ► Patreon:   / datamlistic   ► Bitcoin (BTC): 3C6Pkzyb5CjAUYrJxmpCaaNPVRgRVxxyTq ► Ethereum (ETH): 0x9Ac4eB94386C3e02b96599C05B7a8C71773c9281 ► Cardano (ADA): addr1v95rfxlslfzkvd8sr3exkh7st4qmgj4ywf5zcaxgqgdyunsj5juw5 ► Tether (USDT): 0xeC261d9b2EE4B6997a6a424067af165BAA4afE1a #машинноеобучение #наукаоданных #статистика