R² — это просто квадрат корреляции
DataMListic
0:00 / 0:00
R² — это просто квадрат корреляции
4 100 просмотров · 1 мес. назад
DataMListic
74,3 тыс. подписчиков
4 100 просмотров · 1 мес. назад
Коэффициент детерминации R² часто упоминается в научных статьях, демонстрируется на слайдах и используется для определения работоспособности модели, но если спросить, что он на самом деле измеряет, ответы окажутся расплывчатыми. Это отношение двух величин, и только одна из них имеет отношение к вашей модели. Числитель — это ошибка, которую всё ещё допускает ваша подгонка; знаменатель — это ошибка, которую вы бы допустили, ничего не зная о x, а именно, разброс значений y в той выборке, которую вы собрали.
Такая формулировка объясняет название. Для одного предиктора, подобранного методом наименьших квадратов с учетом свободного члена, алгебра сводится к одному выводу, и R² оказывается в точности равен квадрату коэффициента корреляции Пирсона — одному и тому же числу, имеющему два названия. А поскольку корреляция — это чисто линейное обобщение рассеяния, возведение её в квадрат не может дать информацию о форме. Квартет Анскомба делает это неоспоримым: четыре набора данных, имеющие общее среднее значение, дисперсию, корреляцию, аппроксимирующую линию и оценку 0,67, и которые совершенно не похожи друг на друга при построении графиков.
Остальное следует из знаменателя. Если оставить одну истинную модель неизменной, повторно использовать одни и те же выборки шума и расширить только диапазон значений x, то R-квадрат вырастет с 0,25 до 0,89 без каких-либо изменений в механизме, что делает сравнение этого числа между наборами данных практически бессмысленным. Добавление любого предиктора, включая столбец чистого шума, никогда не сможет его снизить, а скорректированный R-квадрат является скорее слабым фильтром, чем гарантией: бесполезный предиктор все равно повышает его примерно в трети случаев. А знакомый нулевой уровень на самом деле является аргументом вложенности, который справедлив только для внутривыборочных данных, поэтому честная оценка вне выборки может составлять -0,67. Можете указать свой коэффициент детерминации R², но сначала постройте график остатков.
Похожие видео
▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬
Объяснение ковариации и корреляции: • Covariance and Correlation Explained
Метод наименьших квадратов против метода максимального правдоподобия: • Least Squares vs Maximum Likelihood
Коварианционная матрица — объяснение: • Covariance Matrix - Explained
Почему мы делим на N-1 в выборочной дисперсии (поправка Бесселя): • Why We Divide by N-1 in the Sample Varianc...
Переобучение против недообучения — объяснение: • Overfitting vs Underfitting - Explained
Компромисс между смещением и дисперсией — объяснение: • Bias-Variance Trade-off - Explained
Байесовская линейная регрессия: • Bayesian Linear Regression
Гребневая регрессия с гауссовым априорным распределением: • Ridge Regression is a Gaussian Prior
Корреляция Спирмена объяснена за 3 минуты: • Spearman Correlation Explained in 3 Minutes
Содержание
▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬
00:00 - Число в отчете
00:50 - Гонка против прямой линии
03:17 - Аннулирование
05:25 - Четыре набора данных, один результат
07:58 - Знаменатель — ваш эксперимент
09:37 — Почему он никогда не уменьшается
12:25 — Посмотрите на остатки
Подписывайтесь на меня
▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬
🐦 X: @datamlistic https://x.com/datamlistic
📸 Instagram: @datamlistic / datamlistic
📱 TikTok: @datamlistic / datamlistic
👔 Linkedin: / datamlistic
Канал Поддержка
▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬
Лучший способ поддержать канал — поделиться контентом. ;)
Если вы также хотите поддержать канал финансово, пожертвование в размере стоимости чашки кофе всегда приветствуется! (полностью необязательно и добровольно)
► Patreon: / datamlistic
► Bitcoin (BTC): 3C6Pkzyb5CjAUYrJxmpCaaNPVRgRVxxyTq
► Ethereum (ETH): 0x9Ac4eB94386C3e02b96599C05B7a8C71773c9281
► Cardano (ADA): addr1v95rfxlslfzkvd8sr3exkh7st4qmgj4ywf5zcaxgqgdyunsj5juw5
► Tether (USDT): 0xeC261d9b2EE4B6997a6a424067af165BAA4afE1a
#статистика #машинноеобучение #наукаоданных