Обучающая, валидационная и тестовая выборки: зачем нужны все три
DataMListic
0:00 / 0:00
Обучающая, валидационная и тестовая выборки: зачем нужны все три
2 646 просмотров · 4 недели назад
DataMListic
74,4 тыс. подписчиков
2 646 просмотров · 4 недели назад
Модель, которая идеально показывает себя на обучающих данных, всё равно может сильно ошибиться на следующей точке, и известное всем решение — отложить часть данных — имеет свой собственный, едва заметный, сбойный режим. В тот момент, когда вы используете набор данных для принятия решения, выбирая модель, степень полинома, точку остановки, этот набор данных перестаёт измерять обобщающую способность. Выбор — это форма подгонки, и измеренный результат всегда частично истинен, частично удача: выбрав лучшего из множества кандидатов, вы выбираете на удачу.
Всю эту историю мы строим на одной крошечной задаче регрессии: девять зашумлённых точек и степень полинома для выбора. Сначала мы наблюдаем, как интерполянт восьмой степени запоминает каждую обучающую точку и терпит неудачу на новой, а затем выявляем это с помощью отложенного набора данных. Затем следует ловушка: настройка степени на этом отложенном наборе данных незаметно её расходует, и при наличии двенадцати одинаково хороших кандидатов «победителем» оказывается просто самый удачный результат, проклятие победителя. Именно поэтому мы разделяем данные на три части: обучающие данные соответствуют параметрам, данные для валидации запоминают решения, а тестовый набор данных обрабатывается ровно один раз, после того, как все данные зафиксированы, что и делает его ответ достоверным.
Похожие видео
▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬
Переобучение и недообучение — объяснение: • Overfitting vs Underfitting - Explained
Кросс-валидация — объяснение: • Cross-Validation Explained
Почему модели переобучаются и недообучаются — компромисс между смещением и дисперсией: • Bias-Variance Trade-off - Explained
Двойной спуск — почему более крупные модели перестают переобучаться: • Double Descent - Why Bigger Models Stop Ov...
Бутстрап-перевыборка — объяснение: • Bootstrap Resampling - Explained
Гребневая регрессия — объяснение: • Ridge Regression is a Gaussian Prior
Содержание
▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬
00:00 - Идеальный результат
00:42 - Скрыть некоторые данные
01:30 - Ловушка настройки
02:30 - Проклятие победителя
03:21 - Три сета, три работы
04:12 - Один честный ответ
Подписаться Я
▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬
🐦 X: @datamlistic https://x.com/datamlistic
📸 Instagram: @datamlistic / datamlistic
📱 TikTok: @datamlistic / datamlistic
👔 Linkedin: / datamlistic
Канал Поддержка
▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬
Лучший способ поддержать канал — поделиться контентом. ;)
Если вы также хотите поддержать канал финансово, пожертвование в размере стоимости чашки кофе всегда приветствуется! (полностью необязательно и добровольно)
► Patreon: / datamlistic
► Bitcoin (BTC): 3C6Pkzyb5CjAUYrJxmpCaaNPVRgRVxxyTq
► Ethereum (ETH): 0x9Ac4eB94386C3e02b96599C05B7a8C71773c9281
► Cardano (ADA): addr1v95rfxlslfzkvd8sr3exkh7st4qmgj4ywf5zcaxgqgdyunsj5juw5
► Tether (USDT): 0xeC261d9b2EE4B6997a6a424067af165BAA4afE1a
#машинноеобучение #наукаоданных #статистика