Перейти к содержимому

R² — это просто квадрат корреляции

DataMListic

0:00 / 0:00

R² — это просто квадрат корреляции

4 100 просмотров · 1 мес. назад
DataMListic
74,3 тыс. подписчиков
4 100 просмотров · 1 мес. назад
Коэффициент детерминации R² часто упоминается в научных статьях, демонстрируется на слайдах и используется для определения работоспособности модели, но если спросить, что он на самом деле измеряет, ответы окажутся расплывчатыми. Это отношение двух величин, и только одна из них имеет отношение к вашей модели. Числитель — это ошибка, которую всё ещё допускает ваша подгонка; знаменатель — это ошибка, которую вы бы допустили, ничего не зная о x, а именно, разброс значений y в той выборке, которую вы собрали. Такая формулировка объясняет название. Для одного предиктора, подобранного методом наименьших квадратов с учетом свободного члена, алгебра сводится к одному выводу, и R² оказывается в точности равен квадрату коэффициента корреляции Пирсона — одному и тому же числу, имеющему два названия. А поскольку корреляция — это чисто линейное обобщение рассеяния, возведение её в квадрат не может дать информацию о форме. Квартет Анскомба делает это неоспоримым: четыре набора данных, имеющие общее среднее значение, дисперсию, корреляцию, аппроксимирующую линию и оценку 0,67, и которые совершенно не похожи друг на друга при построении графиков. Остальное следует из знаменателя. Если оставить одну истинную модель неизменной, повторно использовать одни и те же выборки шума и расширить только диапазон значений x, то R-квадрат вырастет с 0,25 до 0,89 без каких-либо изменений в механизме, что делает сравнение этого числа между наборами данных практически бессмысленным. Добавление любого предиктора, включая столбец чистого шума, никогда не сможет его снизить, а скорректированный R-квадрат является скорее слабым фильтром, чем гарантией: бесполезный предиктор все равно повышает его примерно в трети случаев. А знакомый нулевой уровень на самом деле является аргументом вложенности, который справедлив только для внутривыборочных данных, поэтому честная оценка вне выборки может составлять -0,67. Можете указать свой коэффициент детерминации R², но сначала постройте график остатков. Похожие видео ▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬ Объяснение ковариации и корреляции:    • Covariance and Correlation Explained   Метод наименьших квадратов против метода максимального правдоподобия:    • Least Squares vs Maximum Likelihood   Коварианционная матрица — объяснение:    • Covariance Matrix - Explained   Почему мы делим на N-1 в выборочной дисперсии (поправка Бесселя):    • Why We Divide by N-1 in the Sample Varianc...   Переобучение против недообучения — объяснение:    • Overfitting vs Underfitting - Explained   Компромисс между смещением и дисперсией — объяснение:    • Bias-Variance Trade-off - Explained   Байесовская линейная регрессия:    • Bayesian Linear Regression   Гребневая регрессия с гауссовым априорным распределением:    • Ridge Regression is a Gaussian Prior   Корреляция Спирмена объяснена за 3 минуты:    • Spearman Correlation Explained in 3 Minutes   Содержание ▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬ 00:00 - Число в отчете 00:50 - Гонка против прямой линии 03:17 - Аннулирование 05:25 - Четыре набора данных, один результат 07:58 - Знаменатель — ваш эксперимент 09:37 — Почему он никогда не уменьшается 12:25 — Посмотрите на остатки Подписывайтесь на меня ▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬ 🐦 X: @datamlistic https://x.com/datamlistic 📸 Instagram: @datamlistic   / datamlistic   📱 TikTok: @datamlistic   / datamlistic   👔 Linkedin:   / datamlistic   Канал Поддержка ▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬ Лучший способ поддержать канал — поделиться контентом. ;) Если вы также хотите поддержать канал финансово, пожертвование в размере стоимости чашки кофе всегда приветствуется! (полностью необязательно и добровольно) ► Patreon:   / datamlistic   ► Bitcoin (BTC): 3C6Pkzyb5CjAUYrJxmpCaaNPVRgRVxxyTq ► Ethereum (ETH): 0x9Ac4eB94386C3e02b96599C05B7a8C71773c9281 ► Cardano (ADA): addr1v95rfxlslfzkvd8sr3exkh7st4qmgj4ywf5zcaxgqgdyunsj5juw5 ► Tether (USDT): 0xeC261d9b2EE4B6997a6a424067af165BAA4afE1a #статистика #машинноеобучение #наукаоданных