Перейти к содержимому

Разделение на обучающие и тестовые данные с использованием машинного обучения Python (Scikit-Learn)

Ryan & Matt Data Science

0:00 / 0:00

Разделение на обучающие и тестовые данные с использованием машинного обучения Python (Scikit-Learn)

101 330 просмотров · 3 года назад
Ryan & Matt Data Science
46,2 тыс. подписчиков
101 330 просмотров · 3 года назад
🧠 Не упустите свой шанс! Получите БЕСПЛАТНЫЙ доступ к моему сообществу Skool — полному ресурсов, инструментов и поддержки, которые помогут вам в работе с данными, машинным обучением и автоматизацией ИИ! 📈 https://www.skool.com/data-and-ai-aut... В этом уроке по машинному обучению на Python мы рассмотрим, как можно разделить набор данных с помощью разделения на обучающую и тестовую выборки в scikit-learn. Это отличный метод подготовки данных перед запуском модели. Код: https://ryanandmattdatascience.com/tr... 🚀 Закажите мои услуги по работе с данными: https://ryanandmattdatascience.com/da... 👨‍💻 Наставничество: https://ryanandmattdatascience.com/me... 📧 Электронная почта: ryannolandata@gmail.com 🌐 Веб-сайт и блог: https://ryanandmattdatascience.com/ 🖥️ Discord:   / discord   📚 * Практические вопросы для собеседования по SQL и Python: https://stratascratch.com/?via=ryan 📖 * Курсы по SQL и Python: https://datacamp.pxf.io/XYD7Qg 🍿 СМОТРЕТЬ ДАЛЕЕ Scikit-Learn Плейлист по машинному обучению:    • Scikit-Learn Tutorials - Master Machine Le...   Масштабирование признаков:    • Python Feature Scaling in SciKit-Learn (No...   Классификатор случайного леса:    • Random Forest Algorithm Explained with Pyt...   Кодировщик порядковых чисел:    • Ordinal Encoder with Python Machine Learni...   В этом видео я покажу вам, как реализовать разделение данных на обучающую и тестовую части в Python с помощью sklearn, одной из важнейших техник машинного обучения. Разделение на обучающую и тестовую части позволяет разделить ваш набор данных на обучающую и тестовую части, обычно используя соотношение 80-20. Это гарантирует, что ваша модель машинного обучения может быть оценена на неизвестных данных, что крайне важно для проверки производительности модели. Мы начнем с импорта необходимых библиотек, включая pandas и функцию train_test_split из sklearn. Я демонстрирую работу с реальным бейсбольным набором данных, содержащим 500 игроков, показывая, как загрузить данные и подготовить их для разделения. Мы рассмотрим, как отделить признаки (X) от целевой переменной (y), и я объясню, почему правильная подготовка данных важна перед запуском любого алгоритма машинного обучения. Я подробно разберу синтаксис функции train_test_split, включая ключевые параметры, такие как test_size и random_state. Параметр random_state особенно важен, поскольку он обеспечивает воспроизводимость — вы будете получать одно и то же разделение каждый раз при запуске кода. Я покажу, как проверить правильность разделения, проверив форму обучающего и тестового наборов данных, и продемонстрирую использование функции describe() для сравнения статистических данных между ними. К концу этого урока вы точно поймете, как реализовать разделение данных на обучающую и тестовую выборки, почему это важно для проектов машинного обучения и как проверить, правильно ли разделены ваши данные для обучения и тестирования модели. ВРЕМЕННЫЕ МЕТКИ 00:00 Введение в разделение данных на обучающую и тестовую выборки 00:36 Настройка среды Python 01:04 Импорт данных для разделения на обучающую и тестовую выборки 01:07 Загрузка набора данных 01:57 Понимание данных 02:21 Создание переменных X и Y 03:19 Изучение структуры данных 03:42 Реализация разделения данных на обучающую и тестовую выборки 04:11 Понимание случайного состояния 04:56 Установка размера тестовой выборки 05:23 Проверка разделения данных 06:23 Изучение обучающих данных 06:52 Сравнение статистики обучающей и тестовой выборок ДРУГИЕ СОЦИАЛЬНЫЕ СЕТИ: LinkedIn Райана:   / ryan-p-nolan   LinkedIn Мэтта:   / matt-payne-ceo   Twitter/X: https://x.com/RyanMattDS Кто такой Райан Райан — специалист по анализу данных в финтех-компании, где он занимается предотвращением мошенничества в сфере андеррайтинга и управления рисками. До этого он работал аналитиком данных в компании, занимающейся разработкой налогового программного обеспечения. Он имеет степень бакалавра электротехники Университета Центральной Флориды (UCF). Кто такой Мэтт Мэтт — основатель Width.ai, агентства, занимающегося искусственным интеллектом и машинным обучением. До создания собственной компании он работал инженером по машинному обучению в Capital One. *Это партнерская программа. Мы получаем небольшую часть от конечной продажи без дополнительных затрат для вас.