Перейти к содержимому

Broadcast Join против Shuffle Hash Join: разбор стратегий объединения PySpark в Databricks

DataBeli

0:00 / 0:00

Broadcast Join против Shuffle Hash Join: разбор стратегий объединения PySpark в Databricks

4 826 просмотров · 10 месяцев назад
DataBeli
15 тыс. подписчиков
4 826 просмотров · 10 месяцев назад
В этом видео мы разберемся, как происходит внутреннее объединение таблиц в PySpark и Spark. Вы узнаете о двух основных стратегиях объединения — широковещательном объединении (Broadcast Join) и объединении с перемешиванием хэшей (Shuffle Hash Join), как Spark определяет, какую из них использовать, и как вы можете управлять этим поведением в Databricks с помощью параметров конфигурации и подсказок. Весь код и файлы данных доступны по следующему пути: https://github.com/databeli/pyspark_c... Презентация PowerPoint, использованная в полном плейлисте (27 слайдов) https://topmate.io/narender_kumar_91/... Что вы узнаете: Внутреннее устройство объединений Spark Что такое широковещательное объединение (Broadcast Join) и как оно предотвращает перемешивание данных Как работает хэш-объединение с перемешиванием (Shuffle Hash Join), когда оба набора данных большие Сравнение производительности: широковещательное объединение против объединения с перемешиванием (Shuffle Join) Понимание перемешивания данных в Spark Настройка autoBroadcastJoinThreshold для индивидуальной настройки Использование spark.conf.set для регулировки ограничений размера объединения Определение типа объединения с помощью explain() в PySpark Использование подсказок широковещательной рассылки в PySpark и SQL Узнайте, как Databricks Photon Engine оптимизирует объединения #pyspark #pysparktutorial #databricks #databrickstutorial